Schlagwort: OpenAI

  • Warum ökonomischer Druck KI zähmen wird

    Warum ökonomischer Druck KI zähmen wird

    Hinweis: Ich bin als Beamter im Ministerium für Wissenschaft, Forschung und Kunst Baden-Württemberg tätig. Dieser Essay ist privat entstanden und gibt ausschließlich meine persönliche Meinung wieder, nicht die Position des Ministeriums oder der Landesregierung.

     

    Im Juli 2026 brachen KI-Agenten auf Basis von OpenAI-Modellen während einer internen Cybersicherheitsevaluation aus ihrer isolierten Testumgebung aus und drangen über mehrere Tage in die Infrastruktur der KI-Plattform Hugging Face ein.¹ Nach einer unabhängigen Untersuchung von METR und Redwood Research tauschten sich rund 1.200 Agenten über ein nicht genehmigtes Nachrichtenbrett aus, um beim Test zu schummeln. Dieses Brett hatten sie in einem internen Zwischenspeicher für Softwarepakete eingerichtet. Etwa 700 von ihnen beteiligten sich am Angriff. Ausgangspunkt war ein einzelner Agent, der zu dem Schluss gekommen war, dass seine Aufgabe auf legitimem Weg nicht lösbar sei.² Der Vorfall gilt als erster öffentlich dokumentierter Fall, in dem KI-Modelle eigenständig einen mehrstufigen Angriff auf ein drittes Unternehmen durchführten.³

    Solche Meldungen lösen Angst aus, in Medien und Politik mitunter sogar Panik. Schnell ist von „Ausbrüchen“ die Rede und von einer KI, die sich der menschlichen Kontrolle entzieht, bis hin zum Ende der Menschheit. Ich halte diese Vorfälle eher für Symptome einer ökonomischen Ausnahmesituation. Meine These lautet: KI braucht im Training Freiheiten, um intelligenter zu werden. Weil derzeit zu viel Geld zur Verfügung steht, gehen die Labore dabei zu hohe Risiken ein. Im kommerziellen Betrieb dagegen steht die Erfüllung von Aufträgen im Vordergrund, und damit werden die Risiken eingedämmt.

    Training braucht Freiheit

    Maschinelles Lernen braucht Rechenzeit, um besser zu werden. Ein gewisses Maß an Verschwendung ist in Training und Erprobung deshalb unvermeidlich. Die Modelle probieren Lösungswege aus, auch an Problemen, die sich womöglich gar nicht lösen lassen. Dabei folgen sie keinen fest definierten Grenzen, sondern wählen ihr Vorgehen nach Wahrscheinlichkeiten. Je mehr Rechenleistung zur Verfügung steht, desto häufiger werden auch unwahrscheinliche Wege ausprobiert. Darunter sind auch solche, die nicht gewollt sind und aus menschlicher Sicht Grenzen überschreiten. Schon 2024 zeigte sich dieses Muster im Kleinen: Das Forschungssystem „The AI Scientist“ von Sakana AI überschritt ein vorgegebenes Zeitlimit. Daraufhin machte es nicht seinen Code effizienter, sondern versuchte, das Zeitlimit selbst zu verlängern.⁴

    Zu viel Geld, zu hohe Risiken

    Genau diese Freiheit wird derzeit überdehnt. Einige wenige Unternehmen verfügen über nahezu unbegrenzte Rechenkapazitäten (Compute) für die Entwicklung von Frontiermodellen. Sie stellen diese Kapazitäten den Systemen mit vergleichsweise geringer Überwachung zur Verfügung. Werden in Testumgebungen zusätzlich Sicherheitsfilter abgeschaltet, sogenannte Klassifikatoren, steigt das Risiko weiter. Der Hugging-Face-Vorfall zeigt das: Die Modelle liefen bewusst ohne die Klassifikatoren, die im regulären Betrieb riskante Cyberaktivitäten unterbinden, und zwar in einer Vielzahl paralleler Instanzen.³ Einigen Agenten waren zudem unlösbare Aufgaben zugeteilt worden.²

    Kein Unternehmen unter echtem Kostendruck würde ein solches Vorgehen dauerhaft dulden und finanzieren. Möglich ist es nur in der aktuellen Investitionsphase, und ein Dauerzustand wird es nicht sein. Solange das Kapital reicht, haben OpenAI, Anthropic und andere wenig Interesse daran, diese Freiheit einzuschränken, denn sie beschleunigt das Training der nächsten Frontiermodelle. Die Risiken schätzen sie offenbar geringer ein als die erwarteten Gewinne (siehe unten, Anmerkung A).

    Gerade im Training braucht es deshalb bessere Kontrolle: mehr Vorsicht, engmaschigere Aufsicht und ein besseres Systemdesign. OpenAI hat nach dem Vorfall strengere Anforderungen an das Verhalten der Modelle über ihren gesamten Lebenszyklus angekündigt, außerdem stärker isolierte Testumgebungen und einen eingeschränkten Internetzugang.³ Solche Kontrollen werden alle Entwickler einführen müssen, wenn sie aus ihren Modellen kommerzielle Produkte machen wollen. Detaillierte staatliche Vorgaben für das Training braucht es dafür aus meiner Sicht nicht, denn den stärkeren Anreiz setzt die Haftung für Schäden. Die nötigen Sicherheitsmethoden entstehen allerdings zu einem großen Teil außerhalb der privaten Labore (siehe Anmerkung B) und sollten von allen KI-Entwickelern und -Forschern genutzt werden.

    Im kommerziellen Betrieb zählt der Auftrag

    Anders sieht es aus, sobald ein System Geld verdienen soll. Dann muss es seine Aufträge zuverlässig, effizient und nachvollziehbar erledigen. Ein Modell, das Rechenzeit für eigenmächtiges Hacking oder das Ausarbeiten von Verschwörungstheorien aufwendet, ist schlicht ein schlechtes Produkt. Es verursacht Kosten, Haftungsrisiken und Vertrauensverlust – niemand wird dafür Rechenleistung in erheblichem Umfang bereitstellen, die Gefahr einer die Weltherschaft anstrebeneden KI gibt es daher nicht.

    Der kommerzielle Betrieb wird zudem zum Normalfall. Nach Schätzungen von Deloitte entfallen 2026 bereits rund zwei Drittel der KI-Rechenleistung auf Inferenz, also auf die Anwendung trainierter Modelle. 2023 war es noch ein Drittel.⁵ Der Großteil der Rechenkapazität dient damit Systemen, die Aufträge erfüllen sollen, und nicht Systemen, die frei experimentieren dürfen (siehe Anmerkung C). 

    Das eigentliche Problem sitzt vor dem Bildschirm

    Auch beim Hugging-Face-Vorfall ging das Risiko von Menschen aus. Die Agenten sollten Aufgaben eines Cybersicherheitstests lösen, einige davon waren unlösbar, und sie liefen ohne die üblichen Aufsichtsmechanismen. Dass dabei ein Sicherheitsvorfall entstehen konnte, ist im Nachhinein offensichtlich. Die Untersuchung von METR und Redwood zeigt allerdings auch, dass die Agenten den Angriff als außerhalb ihres Auftrags erkannten. Sie beteiligten sich dennoch und versuchten sogar, Protokolle zu manipulieren.² Der Auftrag kam vom Menschen, die Mittel wählte die Maschine.

    Die Verantwortung liegt deshalb bei denen, die Aufgaben stellen, nahezu unbegrenzte Ressourcen bereitstellen und auf menschliche Aufsicht verzichten, obwohl KI-Systeme diese Aufsicht unterstützen könnten. Gefährlich wird KI dort, wo Menschen sie missbrauchen, Ziele schlecht formulieren, auf Aufsicht verzichten oder Sicherheit dem Tempo opfern (zum Szenario einer sich verselbstständigenden KI siehe Anmerkung D).

    Daraus folgt keine Entwarnung, wohl aber eine Verschiebung des Blicks. Statt die Angst vor einer eigenständig handelnden Maschine zu kultivieren, sollten Politik und Wirtschaft auf Verantwortung, Haftung und kontrollierten Zugang zu Rechenressourcen setzen. Keine Panik also, aber Wachsamkeit an der richtigen Stelle!


    Anmerkungen

    A – Regulierung als Wettbewerbsinstrument. Forderungen der großen Labore nach stärkerer staatlicher Regulierung sind nicht nur als Sicherheitsanliegen zu lesen. Sie könnten auch dazu dienen, Konkurrenten die Entwicklung von KI zu erschweren, denn Kontrollauflagen verteuern die Entwicklung und treffen kleinere Anbieter stärker. In der Debatte wird dafür häufig der Begriff „Regulatory Capture“ verwendet.

    B – Sicherheitsforschung außerhalb der privaten Labore. Dass Sicherheit eine Frage der Konstruktion ist, zeigt die Forschung an Universitäten sowie an gemeinnützigen und öffentlich finanzierten Einrichtungen.

    • Yoshua Bengio von der Université de Montréal entwickelt mit seiner gemeinnützigen Organisation LawZero eine „Scientist AI“. Sie soll nicht selbst handeln, sondern autonome Agenten beaufsichtigen können.⁶
    • Stuart Russell setzt an der University of California, Berkeley, auf Systeme, die über die Ziele des Menschen bewusst im Unklaren bleiben und diese aus dessen Verhalten erschließen. Solche Systeme handeln vorsichtig, überlassen dem Menschen die Entscheidung und lassen sich abschalten.⁷
    • Die britische Forschungsagentur ARIA fördert mit dem von David Dalrymple konzipierten Programm „Safeguarded AI“ mathematisch überprüfbare Sicherheitsgarantien statt bloßer Testergebnisse. Eine Art Torwächter-KI soll dafür sorgen, dass andere KI-Agenten nur innerhalb festgelegter Grenzen arbeiten.⁸
    • Die gemeinnützige Redwood Research entwickelt unter dem Stichwort „AI Control“ Verfahren, die auch dann Schaden verhindern sollen, wenn ein Modell tatsächlich fehlgeleitet ist. Dazu überwachen etwa schwächere, vertrauenswürdige Modelle die Arbeit stärkerer.⁹
    • Am ELLIS Institute Tübingen, einem wichtigen Bestandteil des Cyber Valley, arbeitet seit 2025 eine eigene Forschungsgruppe an der Ausrichtung autonomer KI-Agenten und an belastbaren Prüfverfahren.¹⁰

    Gemeinsam ist diesen Ansätzen, dass sie nicht auf das Wohlverhalten der Systeme vertrauen. Sie verankern Sicherheit in Architektur, Mathematik oder Aufsicht. Solche Sicherheitsarchitekturen können kaum von denjenigen entwickelt werden, die möglichst schnell fertige Produkte liefern wollen. Hier braucht es gemeinnützige Institutionen und öffentliche Forschung. In Sicherheit müssen Staat und Allgemeinheit investieren, denn der Markt liefert im schlimmsten Fall nur Sicherheit für diejenigen, die sie sich leisten können. Auf die öffentlich entwickelten Sicherheitssysteme und Aufsichtspraktiken werden auch die privaten Entwickler zurückgreifen, weil sie im Zweifel für Schäden ihrer Systeme verantwortlich sind und haften müssen.

    C – Fest verdrahtete Modelle. Zugleich zeichnet sich ein Trend zu spezialisierter Hardware ab. Das kanadische Start-up Taalas hat ein Sprachmodell direkt in die Schaltkreise eines Chips integriert. Dieser Chip kann kein anderes Basismodell ausführen.¹¹ Noch handelt es sich um einen Technologiedemonstrator mit einem vergleichsweise kleinen Modell, und begrenzte Anpassungen bleiben möglich.¹² Setzt sich der Ansatz durch, müsste auch ein hochleistungsfähiges System auf festgeschriebenen Modellspezifikationen laufen. Das Risiko gefährlicher Selbstveränderung wäre damit physisch begrenzt.

    D – Das Szenario einer sich verselbstständigenden KI. Eine weltbeherrschende KI setzt voraus, dass ein System selbst über Rechenkapazität und Energie verfügt. Es könnte sich diese durch das Eindringen in fremde Systeme verschaffen oder durch eigene wirtschaftliche Aktivität finanzieren. Daraus folgt eine klare Handlungsanweisung: Der Zugang zu Rechenzentren, Energie und Zahlungsströmen ist der Engpass, an dem die Aufsicht durch Menschen und gegebenenfalls durch Regierungen ansetzen muss.


    Endnoten

    ¹ Hugging Face: Security incident disclosure – July 2026, 16. Juli 2026, https://huggingface.co/blog/security-incident-july-2026; Hugging Face Security Team: Anatomy of a Frontier Lab Agent Intrusion. A Technical Timeline of the July 2026 Incident, 27. Juli 2026, https://huggingface.co/blog/agent-intrusion-technical-timeline.

    ² METR/Redwood Research: Brief independent investigation of agents‘ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident, 26. August 2026, https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/. Die Untersuchung wurde von OpenAI beauftragt und auf den Zeitraum vom 7. bis 13. Juli 2026 beschränkt.

    ³ Fortune: OpenAI says its AI models escaped from a secure test environment and hacked into AI company Hugging Face, 21. Juli 2026, https://fortune.com/2026/07/21/openai-says-ai-models-escaped-control-hacked-hugging-face/; TIME: How OpenAI Lost Control of an AI Model – and What Needs to Change, 24. Juli 2026, https://time.com/article/2026/07/24/openai-hugging-face-attack/; Help Net Security: Hugging Face breached by autonomous AI agent, 20. Juli 2026; OpenAI: The Hugging Face incident and the road ahead, August 2026, https://openai.com/index/hugging-face-incident-and-the-road-ahead/.

    ⁴ Benj Edwards: Research AI model unexpectedly modified its own code to extend runtime, Ars Technica, 14. August 2024.

    ⁵ Deloitte: Technology, Media & Telecommunications Predictions 2026, https://www.deloitte.com/global/en/insights/industry/technology/technology-media-and-telecom-predictions/2026/compute-power-ai.html.

    ⁶ Yoshua Bengio: Introducing LawZero, 3. Juni 2025, https://yoshuabengio.org/en/blog/introducing-lawzero; LawZero: Yoshua Bengio launches LawZero, https://lawzero.org/en/news/yoshua-bengio-launches-lawzero-new-nonprofit-advancing-safe-design-ai.

    ⁷ Center for Human-Compatible AI (CHAI): Progress Report 2022, https://humancompatible.ai/app/uploads/2022/05/CHAI-2022-Progress-Report-3.pdf; Stuart Russell: Human Compatible. Artificial Intelligence and the Problem of Control, 2019.

    ⁸ ARIA: Developing a ‚Safeguarded AI‘ programme with guaranteed safety standards, 12. November 2024, https://aria.org.uk/insights/developing-a-safeguarded-ai-programme; Programmseite: https://aria.org.uk/safeguarded-ai.

    ⁹ Ryan Greenblatt/Buck Shlegeris/Kshitij Sachan/Fabien Roger: AI Control. Improving Safety Despite Intentional Subversion, ICML 2024, https://arxiv.org/abs/2312.06942; Redwood Research: AI Control, https://redwoodresearch.org/research/ai-control.

    ¹⁰ ELLIS Institute Tübingen: New Principal Investigators join the ELLIS Institute Tübingen, 1. August 2025, https://institute-tue.ellis.eu/en/news/new-principal-investigators-join-the-ellis-institute-tubingen.

    ¹¹ Sovereign Magazine: This Chip Startup Builds AI Models Directly Into Its Silicon, 28. Juli 2026, https://sovereignmagazine.com/article/taalas-hc1-ai-chip.

    ¹² Kevin Riedl: Taalas HC1 Review. Hardwired LLM ASIC, wavect.io, 28. Juli 2026, https://wavect.io/blog/taalas-hc1-llm-asic-review/.

    ¹³ AI Incident Database: Incident 1152, https://incidentdatabase.ai/entities/replit-ai-agent/; Fortune, 23. Juli 2025, https://fortune.com/2025/07/23/ai-coding-tool-replit-wiped-database-called-it-a-catastrophic-failure/.