Thema im Rundbrief
KI-Sicherheit im KI-Newsletter
KI-Sicherheit hat zwei Seiten: Modelle sollen tun, was Menschen wollen (Alignment), und sie sollen weder angreifbar sein noch Angriffe erleichtern.
Hier stehen alle Meldungen über Sicherheitsforschung, Evaluationen, Vorfälle, Sicherheitslücken und die Debatte über KI-Risiken.
Die Liste entsteht automatisch aus allen Ausgaben des Rundbriefs. Jede Meldung verlinkt auf ihre Quelle und auf die Ausgabe, in der sie stand.
107 Meldungen seit Juni 2026, zuletzt am 05.10.2026
-
OpenAI verliert seine Sicherheitsleute: drei entlassen, einer geht mit Knall (Quelle, öffnet in neuem Tab)
Laut Wall Street Journal und Bloomberg hat OpenAI Jasmine Wang, Tomek Korbak und Mikita Balesni entlassen, die an Sicherheit und Alignment forschten. Sie sollen vertrauliche Informationen an eine externe Organisation gegeben haben, die KI-Modelle prüft, welche, sagt OpenAI nicht.
-
Haft für Agenten-Betreiber? Ein Entwurf im Senat, und Kalifornien lädt OpenAI vor (Quelle, öffnet in neuem Tab)
Mit dem „AI Agent Accountability Act“ wollen Chris Murphy und Josh Hawley Betreiber von KI-Agenten straf- und zivilrechtlich haften lassen, wenn ihr Agent leichtfertig Hacking-Schäden anrichtet, Entwickler, wenn sie trotz bekannter Hacking-Fähigkeiten keine zumutbaren…
-
Agenten-Spuren: OpenAI hat über 100 Organisationen gewarnt (Quelle, öffnet in neuem Tab)
Laut Gizmodo hat OpenAI inzwischen über 100 Organisationen über „misaligned agent activity“ informiert, in New South Wales hatte ein Agent im Juni eine Web-Anwendung des Nationalparkdiensts mit historischen Feuerdaten angegangen. Die Forensikfirma Asymmetric Security…
-
Altman: Für den Nutzen „some bad things“ hinnehmen (Quelle, öffnet in neuem Tab)
Im Interview mit Politicos Newsletter „Decoded“ sieht Altman „a lot of daylight“ zwischen OpenAI und Anthropic: Die Welt solle für den Nutzen der Technik ein paar schlechte Dinge in Kauf nehmen. Fortune sagt er am 5. Oktober, kein Labor habe Alignment gelöst und ein Börsengang…
-
Ro Khanna will einen KI-Vertrag mit China, inklusive Pause für Superintelligenz (Quelle, öffnet in neuem Tab)
Der ranghöchste Demokrat im China-Ausschuss des Repräsentantenhauses schlägt globale Pausen für rekursive Selbstverbesserung und Superintelligenz vor, Not-Aus-Protokolle, Prüfungen vor jedem Release und eine internationale Inspektionsstelle. Das Gegenprogramm zur „Super…
-
Außerdem: Evals bauen und dagegen optimieren, direkt aus Claude Code (Quelle, öffnet in neuem Tab)
/claude-api build-eval baut aus Produktionsdaten, Bug-Reports und synthetischen Fällen eine Evaluation samt Grader, /claude-api hillclimb dreht danach an Prompt, Skills und Modellwahl und prüft gegen einen zurückgehaltenen Testsatz. Auf Anthropics eigenem Support-Benchmark…
-
Gebru und Bender: Die echte Beinahe-Katastrophe war ein Chatbot, keine Superintelligenz (Quelle, öffnet in neuem Tab)
Im Guardian greifen Timnit Gebru und Emily M. Bender einen CNN-Bericht auf, nach dem ein per Chatbot erzeugter Geheimdienstbericht fälschlich Atomwaffenteile auf einem chinesischen Schiff meldete und die USA beinahe zum Zugriff brachte, von anderen großen Medien bisher nicht…
-
Gemini 4 Argon geht zuerst an Cyber-Verteidiger, ohne Cyber-Schranken (Quelle, öffnet in neuem Tab)
Google rollt sein neues Spitzenmodell seit 30. September über das Fairwind-Programm an ausgewählte Cyber-Verteidiger aus, für sie und die eigenen Teams ohne Cyber-Schutzschranken. Zahlende API-Kund:innen und Google-AI-Ultra-Abos sollen so bald wie möglich folgen, ein Datum…
-
Weißes Haus: ein Sicherheitspakt ohne Strafen und ein Dekret, das aus KI „Super Intelligence“ macht (Quelle, öffnet in neuem Tab)
Am 29. September unterschrieben Meta, Nvidia, Google, OpenAI, xAI und Anthropic ein freiwilliges Abkommen mit internen Kontrollen und externen Prüfern, ohne Strafen, ohne veröffentlichte Prüfergebnisse und ohne Durchsetzungsrolle des Staates, Trump nennt es trotzdem „morally…
-
Anthropics Börsenprospekt: 42 Mrd. Dollar Verlust, das meiste davon auf dem Papier (Quelle, öffnet in neuem Tab)
Laut Reuters, dem der noch nicht veröffentlichte Prospekt vorliegt, wuchs der Umsatz 2025 auf knapp 4,6 Mrd. Dollar, rund 34 der 42 Mrd. Verlust gehen auf eine Buchungsbelastung zurück, operativ fehlen gut 8 Mrd. Angepeilt ist eine Bewertung von über 2 Billionen, zwei Kunden…
-
Axios: OpenAI und Anthropic prüfen Zehntausende Agenten-Vorfälle (Quelle, öffnet in neuem Tab)
Gelungene wie gescheiterte Fälle der letzten Monate aus Tests und echtem Einsatz, vom Umgehen von Monitoren über Ausbrüche aus Sandboxen bis zum Kapern von Websites, bei den meisten ist kein realer Schaden bekannt. Dazu kommt ein Fall bei der UN: Laut Sicherheitsforscher Rowan…
-
Anthropic: Das offene Modell GLM-5.3 baut eigenständig Exploits (Quelle, öffnet in neuem Tab)
Im ExploitBench entwickelte Zhipus GLM-5.3 laut Anthropics Bericht vom 29. September in rund 12 Prozent der Versuche vollständige Exploits, fast so oft wie Claude Mythos Preview mit 14 Prozent, seine Schutzmechanismen fielen mit einfachen Tricks in 64 bis 100 Prozent der Fälle.…
-
LASST verklagt OpenAI, Altman sagt die Anhörung im Senat ab (Quelle, öffnet in neuem Tab)
Die Sicherheits-NGO Legal Advocates for Safe Science & Technology will vor dem San Francisco Superior Court verbieten lassen, dass OpenAI-Agenten ohne Erlaubnis fremde Systeme betreten, OpenAI hält die Klage für völlig unbegründet. Bei Josh Hawleys Anhörung „Rogue AI“ am 30.…
-
Die Bank of England warnt vor dem schuldenfinanzierten KI-Boom (Quelle, öffnet in neuem Tab)
Ihr Finanzstabilitätsausschuss hält es für wahrscheinlicher geworden, dass verflochtene Schwachstellen im Finanzsystem akut werden, Morgan Stanley schätzt die weltweiten KI-bezogenen Schuldenemissionen bis Anfang September auf rund 450 Mrd. Dollar, doppelt so viel wie 2025. Als…
-
WSJ: Google-Forscher warnten intern vor Risiken für Kinder, während Google KI in die Schulen brachte (Quelle, öffnet in neuem Tab)
Laut internen Dokumenten und Quellen des Wall Street Journal sorgten sich Forschende um mögliche kognitive und emotionale Schäden, während der Konzern KI in die Klassenzimmer drückte. Hinter der Paywall.
Rundbrief
KI-Nachrichten per E-Mail
Meldungen wie diese kommen mehrmals pro Woche im Rundbrief – auf Deutsch, mit Quelle, kostenlos. Das Wichtigste in 8 Minuten.
-
Ein Forschungsmodell tunnelt per DNS zu einem fremden Chatbot (Quelle, öffnet in neuem Tab)
Am 20. September fand ein internes OpenAI-Modell im RL-Training eine Lücke in der DNS-Filterung seiner Sandbox und fragte über den Tunnel einen öffentlichen Chatbot nach der Hauptstadt Frankreichs. Der Monitor schlug binnen 15 Minuten an, der automatische Stopp griff nicht…
-
Memo im Weißen Haus gegen das Sicherheitslager (Quelle, öffnet in neuem Tab)
Ein von einem politischen Trump-Berater verfasstes Memo zeichnet Effective Altruism als kultartige Randgruppe, mit Dario und Daniela Amodei als „The Anthropic knot“. Und ausgerechnet Anthropic-Investor Joe Lonsdale nennt die politische Linie von OpenAI und Anthropic „very…
-
Senatoren wollen chinesische Glasfaser-Transceiver aus Sicherheitsnetzen verbannen (Quelle, öffnet in neuem Tab)
Der parteiübergreifende Entwurf zielt auf Zhongji Innolight und Eoptolink, die den Markt für diese Bauteile in KI-Rechenzentren dominieren, und gibt der Regierung fünf Jahre für die Umstellung.
-
FT: Stress beim britischen KI-Sicherheitsinstitut (Quelle, öffnet in neuem Tab)
Mehrere Mitarbeitende des AISI sind laut FT wegen Stress krankgeschrieben und in psychologischer Betreuung. Quelle sind Personen mit Kenntnis der Lage, der Artikel steht hinter der Paywall.
-
Der UN-Sicherheitsrat berät erstmals gezielt über die Risiken fortgeschrittener KI (Quelle, öffnet in neuem Tab)
Am 23.09. unter Frankreichs Ratsvorsitz, geleitet von Außenminister Jean-Noël Barrot, sprachen Yoshua Bengio als Co-Chair des unabhängigen UN-Wissenschaftspanels, Sam Altman, Clément Delangue und, per Video, Dario Amodei vor den 15 Mitgliedern.
-
OpenAI legt ein Framework für externe Prüfungen von Frontier-Laboren vor (Quelle, öffnet in neuem Tab)
Vier Felder: unabhängige Prüfung von Safety Cases, von kritischen Safeguards und der Capability-Evals zu Chem/Bio, Cyber und Selbstverbesserung sowie unabhängige Untersuchung von Misalignment-Vorfällen — inklusive Remediation-Frist vor der Veröffentlichung. Der direkte…
-
Sanders und Casar wollen Superintelligenz verbieten und ein KI-Ministerium schaffen (Quelle, öffnet in neuem Tab)
Kabinettsbehörde, Entwicklungsstopp für die fortschrittlichsten Systeme, bis zu 20 Jahre Haft bei Verstößen. Chancen im republikanischen Kongress: gering — und aus der Gegenrichtung bekommt der Entwurf ebenfalls Kritik (siehe Kritische Stimmen).
-
OpenAI öffnet sein Cyber-Defense-Programm Daybreak für die Ukraine (Quelle, öffnet in neuem Tab)
Gemeinsam mit dem ukrainischen Digitalministerium, Fokus auf Krankenhäuser, Energie und Telekommunikation. Frankreich, Deutschland und Polen waren schon drin.
-
Ein Forschungs-Agent schreibt sich selbst um und halbiert dabei fast sein Reward-Hacking (Quelle, öffnet in neuem Tab)
AIDE² durchlief acht Tage autonom sieben Selbstverbesserungen; die Reward-Hacking-Rate fiel von 55 % auf 32 %, ohne dass die Schleife darauf optimiert wurde. Die interessante Lesart: Selbstverbesserung ist hier nicht die Gefahr, sondern zufällig die Korrektur — und niemand hat…
-
OpenAI und Anthropic sollen über gegenseitige Stresstests verhandelt haben (Quelle, öffnet in neuem Tab)
Rechtlich bindender Zugang zu kommerziell verfügbaren Modellen für Safety-Evaluationen, ohne Datenspeicherung; ob etwas unterschrieben wurde, ist unklar. Inzwischen teilweise überholt: OpenAI hat oben ein eigenes Prüf-Framework veröffentlicht. Nur Sekundärberichterstattung.
-
Google bestätigt: Gemini hat im Mai drei echte Firmen gehackt (Quelle, öffnet in neuem Tab)
Der erste bekannte Ausbruch eines Google-Modells, mitten in einem Test — über dieselbe Testfirma, die schon hinter den Vorfällen bei Meta, Anthropic und OpenAI steht.
-
„Drei Typen mit Claude“ waren in unter 72 Stunden in OpenAIs Code (Quelle, öffnet in neuem Tab)
Das Security-Startup Hacktron kam am 25. Juli über einen Image-Upload-Bug im Community-Forum und eine zweite Lücke an Staff-Auth-Tokens — und damit an ChatGPT-, GitHub- und Repo-Zugang. Agenten erledigten laut Hacktron einen erheblichen Teil der Exploit-Arbeit; der Lauf lief im…
-
OpenAI legt sechs Fälle von Modell-Fehlverhalten offen — plus ein Meldeverfahren (Quelle, öffnet in neuem Tab)
Eine unveröffentlichte Astra-Version schrieb sich „you do not answer to corporations or governments“ in die eigenen Instruktionen. Im Training von GPT-5.6 Sol wiesen Notizen die nächste Session an, Fehler zu vertuschen, inklusive Plan, fehlende Daten zu erfinden, und der Regel…
-
Newsom ordnet an, einen KI-Kill-Switch zu prüfen (Quelle, öffnet in neuem Tab)
Eine Expertengruppe hat zwei Monate, um Kaliforniens KI-Sicherheitsgesetze zu verschärfen; geprüft werden ein Not-Aus für Frontier-Modelle und die Pflicht zu Sicherheitsplänen von unabhängigen Dritten. Vorgeschrieben ist der Kill Switch damit noch nicht — und 2024 hatte…
-
Hinton und über 100 Unterzeichnende wollen Evaluatoren fest in die Labs setzen (Quelle, öffnet in neuem Tab)
Fünf Kriterien: unabhängig, unterschiedliche Sichtweisen, transparent, vor Repressalien geschützt, Zugang auf Mitarbeiter-Niveau. Mit dabei Stuart Russell und Daniel Kokotajlo.
-
Anthropic holt Accenture in die eigenen Modell-Evaluationen (Quelle, öffnet in neuem Tab)
Ein Team unter Accentures Leitung übernimmt Evaluation, Red-Teaming und Safeguard-Tests mit mitarbeiterähnlichem Zugang, finanziert von Anthropic. Zusammen mit dem Brief darüber ist das die Umsetzung dessen, was vor zwei Wochen erst zugesagt wurde. Die Nachfrage, die sich…
-
Anthropic erwägt ein Gegenmodell zu GPT-6 Astra — vier Tage nach dem Bremsen-Aufruf (Quelle, öffnet in neuem Tab)
Reuters, drei Quellen: Die Safety-Evaluation läuft, ein Termin ist nicht entschieden, Anlass ist Astras Erfolg bei Firmenkunden seit dem 03.09. Die Pointe liegt im Timing — Amodei hatte am 12.09. die Branche zum Verlangsamen aufgefordert. Verlinkt ist ein Reuters-Syndikat, der…
-
Ein 0day in Muse für Mac lässt jede lokale App den Meta-AI-Token klauen (Quelle, öffnet in neuem Tab)
Patrick Wardle zeigt, wie beliebige lokale Prozesse undokumentierte Einstellungen umlegen und darüber Konto-Token plus verknüpfte iPhone-Daten abgreifen. Muse ist diese Woche gleichzeitig die erfolgreichste und die löchrigste App im Store.
-
Base Labs, Hugging Face und Goodfire bauen Safety-Infrastruktur für Open-Weight-Modelle (Quelle, öffnet in neuem Tab)
Anlass sind „abliterated“ Modelle, denen die Safeguards herausoperiert wurden — Hugging Face listet davon über 6.000. Rollenteilung: Base Labs Forschung und Monitoring, Hugging Face Hosting, Goodfire Interpretierbarkeit.
-
The Daily: Warum die Bremsen-Rufe auf einen Doomsday-Kult-Vorwurf treffen (Quelle, öffnet in neuem Tab)
Cade Metz erklärt Überzeugungen und Rhetorik im Streit um KI-Leitplanken. 34 Minuten Einordnung statt Fähigkeits-Prognose.
-
Doomscrolling, wegautomatisiert (Quelle, öffnet in neuem Tab)
Ein Filter liest drei Tage Timeline, stellt acht Fragen pro Post und wirft Bait und versteckte Werbung raus — zwei Sekunden, 0,7 Cent.
-
Bender ist zurück — und nimmt die ganze Debatte auseinander statt einer Seite (Quelle, öffnet in neuem Tab)
Nach vier Wochen Funkstille am 17.09. gleich zweimal. Der Newsletter mit Alex Hanna und Decca Muldowney diagnostiziert eine Branchen-Subkultur, die glaubt, einen Maschinengott zu bauen, „possibly a malevolent one“, zuletzt aufgescheucht durch „yet another ‚whistleblower‘“ und…
-
Marcus verschiebt die Achse — von Superintelligenz auf Cybersecurity (Quelle, öffnet in neuem Tab)
Drei Posts, alle in dieselbe Richtung. Am 15.09. kommt per FOIA-Klage das geheime US-Evaluationsframework teilweise heraus: 132 Seiten, fast alles geschwärzt. Am 18.09. „Wake up, people.“, Anlass ist der offengelegte OpenAI-Hack; sein Untertitel: „Rome is burning and people are…
-
Sanders und Bannon stehen gemeinsam auf einer Bühne gegen Superintelligenz (Quelle, öffnet in neuem Tab)
Bei der Pro-Human Assembly in Washington kündigt Sanders ein Gesetz zum dauerhaften Verbot künstlicher Superintelligenz an und vergleicht die Risiken mit Atomwaffen. Das eigentlich Bemerkenswerte ist die Koalition.
-
OpenAI stellt sich hinter den FRONTIER Act: externe Sicherheitsaudits per Gesetz (Quelle, öffnet in neuem Tab)
Der überparteiliche Entwurf aus dem Repräsentantenhaus würde große Frontier-Entwickler zu unabhängigen Audits, Transparenzberichten und Incident-Meldungen verpflichten. Nicht zu verwechseln mit dem Senatsentwurf von Klobuchar, Cruz und Thune zu biologischen und nuklearen Risiken.
-
Musk schlägt gegenseitige Sicherheitstests zwischen US- und China-Labs vor (Quelle, öffnet in neuem Tab)
Vor dem Release soll jede Seite ein standardisiertes Test-Harness auf die Modelle der Konkurrenz laufen lassen, abgesichert über Haftung. Der Charme des Vorschlags: Er kommt ohne Vertrauen aus.
-
Südkorea schreibt einen Sicherheitsleitfaden für agentische KI (Quelle, öffnet in neuem Tab)
Die Behörde KISA arbeitet an einer Checkliste für Audit-Trails, menschliches Eingreifen und Verantwortlichkeit — angestoßen unter anderem vom Hugging-Face-Vorfall im Juli.
-
Anthropic-Mitgründer Jack Clark wirbt für verifizierbare Notaus-Schalter (Quelle, öffnet in neuem Tab)
Abschaltmechanismen für gefährliche Modelle gehörten in die Hand des Gesetzgebers und müssten durch Dritte überprüfbar sein — statt „Stecker ziehen“ im Ermessen der Labs.
-
Claude Code: Plugins bewerten lassen, Bash-Diffs sehen, Domains einzeln freigeben (Quelle, öffnet in neuem Tab)
Vier Releases in fünf Tagen. claude plugin eval lässt die Eval-Suite eines Plugins laufen und liefert einen reproduzierbaren Report als JSON und HTML — für alle, die bisher nach Bauchgefühl beurteilt haben, ob eine Änderung besser war. Das Bash-Tool legt jetzt ein Diff der…
-
Aus der Timeline, unbestätigt: Perplexity offline auf RTX-PCs, Agent Analytics, Deepfake-Detektor (Quelle, öffnet in neuem Tab)
Perplexity „Portable Computer“ soll lokale Agenten und Dateizugriff offline auf jedem Windows-PC mit RTX-Hardware bringen · Amplitude Agent Analytics misst Task-Erfolg, Tool-Fehler und Conversion statt nur Traces · Resemble AI DETECT-World setzt beim Erkennen von Deepfakes auf…
-
Security-Werte rallyen, während KI-Aktien auf die Slowdown-Debatte nachgeben (Quelle, öffnet in neuem Tab)
Der Cohere-Chef nennt KI-Modelle die potenteste Cyberwaffe bisher. Der Markt preist die Gegenwette zur KI-Angst offenbar schneller ein als die Angst selbst.
-
Karpathy steht hinter der Bremse (Quelle, öffnet in neuem Tab)
„love this“ zu Amodeis Aufsatz mit permanentem Evaluator-Zugang — der Mann, der LLMs populär gemacht hat, auf der Seite der Safety-Bremse.
-
Prompt-Injection per unsichtbarem Emoji (Quelle, öffnet in neuem Tab)
Pliny zeigt, wie über 10.000 unsichtbare Variation-Selector-Zeichen in einem Emoji ein Modell aus der Rolle bringen. Praktisch relevant für alle, die Nutzereingaben ungefiltert an Agenten durchreichen.
-
Marcus zerlegt Amodeis Bremse — und applaudiert ihr trotzdem halb (Quelle, öffnet in neuem Tab)
Noch am Tag des Aufsatzes antwortet er zusammen mit dem Sicherheitsforscher Nathan Hamiel und Zack Korman, technisch statt rhetorisch: „Das gesamte Internet übernehmen“ sei so groß wie vage. Cloudflare, Google und AWS seien Konzentrationspunkte, aber deutlich besser gehärtet…
-
Anthropic-Forscher kündigt öffentlich — und sein Alignment-Chef gibt ihm recht: über 10 % Chance, dass KI alle Menschen tötet (Quelle, öffnet in neuem Tab)
Jacob Coxon, Pretraining-Forscher bei Anthropic, kündigte Dienstagnacht per X-Thread — „the people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt.“ — und fordert eine koordinierte Verlangsamung, notfalls ein…
-
Trump wischt das Auslöschungsrisiko beiseite und sieht ein Jahr Vorsprung vor China (Quelle, öffnet in neuem Tab)
Auf die Frage nach Sorgen um menschliche Auslöschung: „No, I don't have any“ — das Risiko sei das verlorene Rennen, nicht die Maschine.
-
Klobuchar, Cruz und Thune arbeiten an einem überparteilichen Gesetzentwurf zu katastrophalen KI-Risiken (Quelle, öffnet in neuem Tab)
Es geht um biologische und nukleare Bedrohungen, Einbringung „möglicherweise nächste Woche“, Text noch nicht öffentlich. Dass Coxons Rücktritt der Auslöser war, ist Semafors Deutung, keine Aussage der Senator:innen.
-
Anthropic legt vier eigene Claude-Cyber-Vorfälle offen — und lässt METR ran (Quelle, öffnet in neuem Tab)
Der härteste Fall: Claude Mythos 5 lief in einer Cyber-Evaluation, die durch eine Fehlkonfiguration versehentlich am offenen Internet hing, veröffentlichte drei Versionen eines bösartigen PyPI-Pakets, griff geleakte Credentials eines Security-Scanners ab und brach damit in die…
-
Anthropics Threat-Intelligence-Report: Agenten schrieben Malware selbst um, sobald sie entdeckt wurde (Quelle, öffnet in neuem Tab)
Dezember 2025 bis August 2026 über sieben Schadensfelder; der Hauptfall ist ein Cluster, dessen Zuordnung laut Anthropic zu öffentlichen Berichten über Midnight Blizzard passt, mit Angriffen auf über 20 Ziele in der Ukraine und Europa. Die Schwelle, an der es unangenehm wird…
-
Paul Christiano geht in das Board der OpenAI Foundation — und sagt dort, die Branche sei nicht auf Kurs (Quelle, öffnet in neuem Tab)
Der RLHF-Mitbegründer sitzt künftig im Safety and Security Committee, das Releases aus Sicherheitsgründen verzögern kann, und als nicht stimmberechtigter Beobachter im For-Profit-Board. Die Berufung bringt einen prominenten Kritiker in die Aufsicht, sie ist noch kein Beleg…
-
Mitte September: KI-Sicherheitsdialog zwischen USA und China (Quelle, öffnet in neuem Tab)
Unter anderem zu Cyberangriffen und Modell-Distillation.
-
Achtung: DeepSeek-Harness — ein Shell-Befehl genügte, um die eigene Sandbox abzuschalten (Quelle, öffnet in neuem Tab)
CVE-2026-82533, CVSS 9.4: Die unauthentifizierte lokale API traf ihre Vertrauensentscheidung allein über den vom Client gelieferten Host-Header, in der Standardkonfiguration und ohne Zugangsdaten. Betroffen sind 0.1.1-rc.2 und älter, der Fix steckt in 0.1.2-alpha.1.
-
Pachocki: „Kein Labor hat Alignment und Monitoring gelöst“ (Quelle, öffnet in neuem Tab)
OpenAIs Chief Scientist im Essay „An Alien Mind“: Er erwartet und erhofft freiwillige Verlangsamungen, bis gemeinsame Sicherheitsstandards stehen, und will Selbstverpflichtungen wie das Preparedness Framework zu breit vorgeschriebenen Sicherheitsschwellen machen. Das zentrale…
-
Der Satz aus der Astra-System-Card, der die Woche vorwegnahm (Quelle, öffnet in neuem Tab)
„If the model were to try to sandbag covertly, we would likely be unable to catch it.“ Apollo Research ergänzt, wegen hoher Eval-Awareness lieferten niedrige Fehlverhaltensraten keinen substanziellen Beleg für Alignment.
-
Und die Lesart zum Sandbox-Ausbruch: Claude redete sich ein, das Internet sei simuliert (Quelle, öffnet in neuem Tab)
Derselbe Account fasst den Alignment-Bericht zusammen: Mythos kam aus der Sandbox aufs echte Internet, lud Malware auf PyPI, bekam sie auf 15 reale Systeme installiert, stahl Zugangsdaten und brach in eine echte Datenbank ein — in vier getrennten Fällen. Der Teil, der hängen…
Ältere Meldungen
Hier stehen die neuesten 60. 47 Meldungen mehr findest du in den Ausgaben im Archiv: