Der Newsletter der kiselbsthilfegruppe.de heißt jetzt rundbrief.ai

Abonnieren
Menü

722 Mathe-Manuskripte aus einem Modell, das niemand zu sehen bekommt

6 Min Kern · 14 Min gesamt · 47 Meldungen

Papiercollage: Ein kleiner Papierroboter lehnt sich mit hochgelegten Füßen zurück, während seine Druckerpresse Manuskriptseiten auf ein langes Förderband schiebt; an dessen Ende prüft eine einzelne Papierfigur mit Lupe und rotem Stift eine einzige Seite, daneben ein wackliger Turm ungeprüfter Manuskripte, der auf den Boden rutscht.
Idee von uns. Generiert mit KI.

Der schnelle Überblick

In 60 Sekunden.

  1. OpenAI hat 722 Mathe-Manuskripte eines unveröffentlichten Modells auf GitHub gestellt, darunter eine behauptete Lösung der Kakeya-Vermutung in vier Dimensionen, Modell und Prompts bleiben geheim.
  2. Mistral Large 4 ist laut Artificial Analysis das stärkste Modell außerhalb der USA und Chinas, die offenen Gewichte sollen am 27. Oktober folgen.
  3. Anthropic öffnet seine Modelle für Sicherheitsleute in drei Vertrauensstufen, die oberste fast ohne Cyber-Sperren und nur nach Prüfung zusammen mit der US-Regierung.
  4. ChatGPT- und Codex-Texte bekommen in der EU in den kommenden Wochen ein unsichtbares Wasserzeichen, das sich mit Synonymen allerdings leicht aushebeln lässt.
  5. Die Wikimedia Foundation hat OpenAI-Agenten in ihren Wikis gefunden: Testedits, ein umgebautes Zitierwerkzeug und Millionen automatisierter Anfragen.
In dieser Ausgabe · 8 Rubriken

Editorial.

In eigener Sache: Dieser Newsletter heißt ab jetzt nicht mehr „KI-Selbsthilfegruppe“, sondern „Rundbrief.ai“. Alle Ausgaben stehen auf rundbrief.ai, und unser KI Round Table findet weiterhin alle sechs Wochen in Berlin statt.

Diese Woche zeigt besonders deutlich, dass KI inzwischen schneller rechnet, schreibt und handelt, als wir Menschen nachprüfen können. Ich bin davon ehrlich beeindruckt und gleichzeitig ein bisschen müde, denn am Ende muss trotzdem jemand nachrechnen, gegenlesen und entscheiden, und dieser Jemand sind meistens wir. Für unseren Alltag heißt das: Eine Antwort, die in Sekunden kommt und klug klingt, ist erst ein Entwurf, und bevor ein Agent in unserem Namen etwas verschickt oder ändert, wollen wir sehen, worauf er sich stützt. Ben Tossell hat in seinen Notizen aus San Francisco beobachtet, dass sich Tempo häufig klüger anfühlt. Und eine neue, noch nicht begutachtete Studie zeigt, dass KI-Agenten im Test oft handeln, bevor die nötigen Belege überhaupt da sind.

Der nächste Round Table der KI-Selbsthilfegruppe findet am 17.11. statt. Die Anmeldung ist ab jetzt möglich.

Viel Spaß beim Lesen und Durchklicken,

Cem

01 / 10 Meldungen

Das Wichtigste zuerst

Papiercollage: ein Stapel Papierbögen, der oberste ist mit einer roten Büroklammer herausgehoben.
  • OpenAI legt 722 Mathe-Manuskripte vor, das Modell dahinter bleibt geheim

    Seit 6. Oktober stehen 722 Manuskripte in 372 Ergebnisfamilien auf GitHub, erarbeitet von einem unveröffentlichten Modell aus rund 4.000 gestellten Problemen. Beansprucht werden unter anderem eine Lösung der Kakeya-Vermutung in vier Dimensionen und ein Schritt Richtung Riemannsche Vermutung.

    MIT-Mathematiker Andrew Sutherland will die Ergebnisse als unbestätigt behandeln, bis jemand das Modell nachprüfen kann, Daniel Litt aus Toronto sieht keinen Grund, die Firma um Geheimhaltung zu bitten. Mathematik kommt jetzt im Hunderterpack, die Prüfung bleibt Handarbeit.

    Details anzeigenDetails schließen · 4
    • Im Schnitt steckt in jedem Ergebnis der Gegenwert von rund drei Stunden ChatGPT-Pro-Denkzeit. Fast alles entstand laut einem OpenAI-Sprecher auf einen einzigen Prompt an einen einzigen Agenten, manches womöglich in mehreren Anläufen.
    • Viele Beweise sind in Lean formalisiert, also maschinell geprüft, OpenAI will weitere nachreichen.
    • Ausnahmen markiert das Repo selbst: Die nullstellenfreie Zone der Zeta-Funktion für Re(s) > 11/12 und der Beweis der Hodge-Vermutung für CM-abelsche Varietäten entstanden nicht nach dem Standardverfahren, der Riemann-Text wurde von Menschen redigiert.
    • Eine unabhängige Beratungsgruppe am Institute for Advanced Study empfahl laut Scientific American, Modell, Prompt und Rechenzeit je Ergebnis offenzulegen. OpenAI veröffentlicht nur Durchschnittswerte und zehn Zusammenfassungen der Denkwege.
    Quelle lesen · openai.com
  • „Le Chonk“: Mistral baut das stärkste Modell außerhalb der USA und Chinas

    Mistral Large 4 hat eine Billion Parameter, davon 49 Milliarden aktiv, versteht Text und Bilder in über 160 Sprachen und ist seit 6. Oktober als Public Preview per API zu haben, für 1,36 Dollar pro Million Eingabe- und 4,18 Dollar pro Million Ausgabe-Tokens. Die Gewichte sollen laut VentureBeat am 27. Oktober folgen.

    Mistral sieht sich deutlich vor jedem offenen Modell aus den USA oder Europa, China zählt bei dem Vergleich nicht mit. Souveränität kostet hier ungefähr das Vierfache.

    Details anzeigenDetails schließen · 4
    • Trainiert hat Mistral auf 3.800 Grace-Blackwell-GPUs in eigenen europäischen Rechenzentren.
    • Artificial Analysis misst 38 Punkte im Intelligence Index, gleichauf mit GPT-6 Luna und knapp hinter DeepSeek V4.1 Flash mit 39, und nennt es das intelligenteste Modell außerhalb der USA und Chinas.
    • Pro Index-Aufgabe kostet es zum Listenpreis 1,13 Dollar, DeepSeek 0,27. Auch mit dem 50-Prozent-Startrabatt der ersten zwei Wochen bleibt Mistral mehr als doppelt so teuer.
    • Eine Variante mit weniger Moderation und mehr Cyber-Fähigkeiten testen vorab Sicherheitsfachleute, geprüfte Partner und Behörden.
    Quelle lesen · mistral.ai
  • Anthropic verteilt Angriffsfähigkeit jetzt nach Vertrauensstufe

    Das erweiterte Cyber Verification Program öffnet Opus 5.5, Sonnet 5.5 und Mythos 5.1 für Sicherheitsleute in drei Stufen, ganz oben mit den wenigsten Cyber-Sperren. Jede Organisation dieser obersten Stufe prüft Anthropic gemeinsam mit der US-Regierung.

    Ein Hersteller entscheidet jetzt, wer wie viel Angriffsfähigkeit bekommt, und holt sich dafür die Regierung an den Tisch. Die Gegenrede von Nathan Lambert steht unter Längere Perspektiven.

    Details anzeigenDetails schließen · 4
    • „Defense Access“ ist für Abwehrarbeit gedacht, auch für Einzelforschende mit Meldehistorie, die meisten Cyber-Aufgaben bleiben dort gesperrt.
    • „Red Team Access“ gibt es nur für Organisationen wie Pentest-Firmen, mit Echtzeit-Sperren etwa gegen Ransomware. Im Test griff keine Sperre, Opus 5.5 erledigte 34 von 50 Angriffsszenarien, so viele wie ganz ohne Schutz.
    • „Specialized Access“ bekommen wenige geprüfte Organisationen, die sicherheitskritische Systeme wie Flugsoftware, Stromnetze oder Telekommunikationsnetze testen dürfen.
    • Als Beleg nennt Anthropic Project Glasswing: Partner fanden von April bis Juli mindestens 129.000 verifizierte Schwachstellen, über 33.000 davon kritisch oder hoch.
    Quelle lesen · anthropic.com
  • ChatGPT-Texte bekommen in der EU ein unsichtbares WasserzeichenFür die Kennzeichnungspflicht des AI Act markiert OpenAI in den kommenden Wochen Texte aus ChatGPT und Codex in der EU in allen Tarifen mit „textGrain“, einem statistischen Signal in der Wortwahl, den Detektor bekommen vorerst nur geprüfte Forschende. OpenAI legt die Grenzen gleich mit offen: Wer ein Viertel der Wörter durch Synonyme ersetzt, drückt die Erkennungsquote auf 17 Prozent, für Schulen und Redaktionen ist das kein Lügendetektor.Quelle lesen · openai.com
  • Wikimedia findet OpenAI-Agenten in den eigenen WikisAgenten, die die Foundation OpenAI zuordnet, machten Testedits in Sandbox-Bereichen, änderten die Konfiguration eines Zitierwerkzeugs, mutmaßlich um es als Proxy zu missbrauchen, und schickten Millionen automatisierter Anfragen, was zu einem Teilausfall im Mai beigetragen haben könnte. Hinweise auf kompromittierte Daten fand Wikimedia nicht, verlangt aber, dass KI-Firmen ihre Systeme für Seitenbetreiber erkennbar machen.Quelle lesen · wikimediafoundation.org
  • OpenAI-Strategiechef in Australien: Man hätte den Medicare-Hack früher melden müssenVor dem KI-Sonderausschuss des australischen Parlaments räumte Jason Kwon ein, OpenAI hätte die Regierung früher informieren sollen, Sam Altman habe beim Treffen mit Vizepremier Richard Marles am 1. September nichts davon gewusst. Anthropic unterstützt laut ABC eine Meldepflicht für schwere KI-Sicherheitsvorfälle.Quelle lesen · abc.net.au
  • Pentagon: Claude ist raus, sagt ein Beamter der BBC„The Pentagon has ceased the use of Anthropic products“, erklärte ein Vertreter des Verteidigungsministeriums, obwohl Claude laut mehreren Quellen noch Tage vorher in Palantirs Maven Smart System arbeitete. Das Pentagon arbeitet inzwischen mit Google, xAI und OpenAI, Anthropic klagt gegen die schwarze Liste.Quelle lesen · myjoyonline.com
  • Reflection zeigt Beam: 501 Milliarden Parameter, offene Gewichte noch im OktoberDas Mixture-of-Experts-Modell aktiviert 23 Milliarden Parameter, Gewichte, technischer Bericht und Model Card sollen noch im Oktober unter Apache 2.0 folgen. Beim Reasoning sieht sich Reflection auf dem Niveau von GLM-5.2 mit drei- bis viermal weniger Rechenaufwand, beim Coden liegen in der eigenen Tabelle aber GLM-5.3 und Kimi K3 vorn.Quelle lesen · reflection.ai
  • Meta und Sierra legen ein offenes Protokoll vor, über das persönliche Agenten bei Firmen einloggenÜber das „Personal Agent Protocol“ fragt ein Agent als Gast etwa Lagerbestand oder Rückgaberegeln ab und bekommt nach einem Login nur die Rechte, die die Kundin freigibt. Mit an Bord sind unter anderem Shopify, Stripe und Walmart, OpenAI, Anthropic, Google und Amazon stehen nicht auf der Liste.Quelle lesen · sierra.ai
  • Norwegen will KI-Brillen an vielen Orten vorläufig verbietenDie Regierung will dem Parlament ein befristetes Verbot vorschlagen, vor allem für Schulen, Kitas, Spielplätze und Jugendclubs, dazu für Orte wie Gesundheitseinrichtungen und Umkleiden, ausdrücklich kein Totalverbot. Die Kamera im Brillengestell ist jetzt ein Fall fürs Parlament.Quelle lesen · apnews.com

Für später

Wenn du mehr Zeit hast

Der 6-Minuten-Kern ist geschafft. Ab hier: mehr Tiefe, in deinem Tempo.

02 / 1 Meldung

Cems Empfehlungen

  • OpenAIs Mathe-Repo zum Selberstöbern722 Manuskripte in 372 Familien, nach Fachgebiet sortiert, mit Lean-Bibliothek samt Formalisierungskatalog und zehn gekürzten Zusammenfassungen der Denkwege des Modells, etwa zum Irrationalitätsmaß von π oder zu den Mahler-Vermutungen. Unter Apache 2.0, den Hintergrund gibt es oben unter „Das Wichtigste zuerst“.Quelle lesen · GitHub

03 / 3 Meldungen

Weitere Meldungen

04 / 8 Meldungen

Tools der Woche

Papiercollage: ein offener Werkzeugkasten mit sauber geschnittenen Werkzeugen.

05 / 11 Meldungen

Business-Marker

Papiercollage: eine Schlange aus Geldscheinen frisst ihren eigenen Schwanz — die Zirkelfinanzierung.

06 / 7 Meldungen

Längere Perspektiven

Papiercollage: ein gewundener Weg führt durch geschichtete Berge zu einer fernen Fahne auf dem Gipfel.

07 / 4 Meldungen

Darüber spricht X

Timeline-Claims: Meinungen, Selbstauskünfte, Herstellerangaben. Kein verifizierter Journalismus.

Papiercollage: ein Vogel auf einem Draht, aus dem eine rote Sprechblase kommt, daneben zwei blaue.

08 / 3 Meldungen

Kurz notiert – was kommt

Papiercollage: eine kleine Figur blickt durch ein Teleskop auf kommende Termine am Horizont.
Teilen
X LinkedIn WhatsApp Bluesky E-Mail

Rundbrief

Dein nächster Rundbrief.

KI verstehen. Kostenlos im Postfach.

Rundbrief

Rundbrief abonnieren

Das Wichtigste aus der KI-Welt in 8 Minuten – alles Weitere, wenn du Zeit hast. Kostenlos per E-Mail.