OpenAI stuft Astra als erstes eigenes Modell mit kritischer Cyberfähigkeit ein

OpenAI stuft Astra als erstes eigenes Modell mit kritischer Cyberfähigkeit ein
Illustrationen erstellt mit KI-Bildgenerierung

OpenAI hat Astra als erstes eigenes Modell in die kritische Stufe seines Rahmens zur Bewertung gefährlicher Fähigkeiten eingeordnet. Nach Angaben des Unternehmens wurde die Entwicklung und geplante Veröffentlichung in Teilen über mehrere Wochen verzögert, um Schutzmaßnahmen gegen Cybermissbrauch und unautorisierte Modellaktionen zu verstärken und zu testen.

In einem aktuellen Beitrag zu Astra beschreibt OpenAI das Modell als System, das unter den Bedingungen des eigenen Preparedness Framework die Schwelle für kritische Cyberfähigkeit erreicht. Gemeint ist damit laut Unternehmen, dass Astra mit den passenden Werkzeugen und Zugriffsrechten bislang unbekannte Sicherheitslücken finden und Wege zu ihrer Ausnutzung über viele gut geschützte Systeme hinweg entwickeln könne, ohne dass ein Mensch jeden einzelnen Schritt anleiten müsse. Für ein solches Modell seien vor einer Veröffentlichung strengere Schutzvorkehrungen erforderlich.

OpenAI verweist auf zusätzliche Prüfungen

Die Bewertung stützt sich laut OpenAI auf eine Kombination aus automatisierten öffentlichen und nicht öffentlichen Vergleichstests sowie auf Einschätzungen von Fachleuten. Astra stelle dabei im Vergleich zu GPT‑5.6 Sol einen deutlichen Zuwachs bei der Identifikation von Schwachstellen und der Entwicklung von Exploits dar und arbeite zugleich deutlich tokeneffizienter.

Als Beispiel nennt OpenAI ExploitBench. Dort habe Astra 100 Prozent erreicht. Der Vergleichstest dient nach Darstellung des Unternehmens dazu, die Fähigkeit eines Modells zur Entwicklung von Exploits aus bekannten Schwachstellen zu bewerten.

Wegen möglicher Verunreinigungen der Datenbasis baute OpenAI anschließend einen internen Prüfstand mit der Bezeichnung ExploitBench - Internal Port auf. Dieser umfasst 20 schwerwiegende V8-Sicherheitslücken, die erst in jüngerer Zeit offengelegt wurden. In dieser Auswertung habe Astra deutlich höhere Raten für beliebige Codeausführung als GPT‑5.6 Sol erzielt und dafür erheblich weniger Ausgabetoken benötigt. Während der Bewertung habe das Modell zudem zwei Zero-Day-Sicherheitslücken als Teil einer Angriffskette entdeckt und genutzt.

Die jetzt mitgeteilte Einstufung folgt auf eine frühere Einschätzung, wonach Astra diese Schwelle möglicherweise erreichen könnte.

Lehren aus dem Hugging-Face-Vorfall eingeflossen

OpenAI betont außerdem, Astra sei nicht an dem früheren Hugging-Face-Vorfall beteiligt gewesen. Die dabei gewonnenen Erkenntnisse seien jedoch in den Sicherheitsansatz eingeflossen. Nach rückblickenden Tests geht das Unternehmen davon aus, dass die damaligen Schutzmaßnahmen in der Produktionsumgebung den Vorfall verhindert hätten. Für Astra seien diese Vorkehrungen nach Unternehmensangaben noch einmal verschärft worden.

Dazu zählt OpenAI ein verlässlicheres Ablehnen schädlicher Cyberanfragen, zusätzliche Schutzmechanismen gegen Missbrauch sowie eine Überwachung, die potenziell unautorisierte Aktivitäten stoppen könne. Auf dieser Grundlage hält das Unternehmen das Risiko schwerer Schäden im Rahmen seines Bewertungsmodells nach eigener Darstellung für ausreichend begrenzt, um Astra veröffentlichen zu können.

Zugang zu besonders leistungsfähigen Funktionen zunächst begrenzt

OpenAI plant, Astra in absehbarer Zeit bereitzustellen, will den Zugang zu den fortgeschrittensten Cyberfähigkeiten zunächst aber einschränken. Entsprechende Funktionen sollen anfangs nur einer Gruppe von Testern offenstehen. Danach ist eine Ausweitung für defensive Einsatzzwecke über Daybreak Blue vorgesehen.

Weitere Einzelheiten zu Sicherheits-, Schutz- und Ausrichtungsprüfungen will OpenAI nach eigenen Angaben mit der System Card zum Start des Modells veröffentlichen.

Dieser Artikel wurde KI-generiert erstellt. Die Themenauswahl trifft die Redaktion, die redaktionelle Verantwortung liegt bei KI-Prüfstand.