Artificial Analysis startet mit Optima ein Werkzeug für eigene KI-Benchmarks
Artificial Analysis hat mit Optima ein neues Werkzeug für eigene KI-Benchmarks vorgestellt. Die Plattform soll Aufgaben aus dem Unternehmensalltag in wiederholbare Tests überführen und Modelle nicht nur nach Qualität, sondern auch nach Kosten und Laufzeit vergleichen.
Auf der Produktseite von Optima beschreibt Artificial Analysis das System als Lösung für „custom benchmarks“ auf Basis eigener Daten, Agent-Trajektorien oder eines eigenen Agenten. Die Seite gliedert den Ablauf in Build, Run und Grade; weiter unten folgt zudem ein Abschnitt „Grade and decide“. In dem gezeigten Beispiel zur Vertragsprüfung umfasst der Benchmark 24 Aufgaben, 4 Kategorien und ergänzende Rubrics. Als verglichene Modelle werden unter anderem Claude Fable 5, GPT-5.6 Sol, Kimi K3 und Gemini 3.6 Flash genannt.
Vergleich von Qualität, Kosten und Laufzeit
Optima soll den Aufwand für Benchmarking deutlich senken und zeigt deshalb nicht nur einen Score, sondern auch Kosten und Zeit pro Aufgabe an. Im gezeigten Vertragsbeispiel erreicht Claude Fable 5 einen Score von 60 bei Kosten von 0,18 US-Dollar und 74 Sekunden pro Aufgabe. GPT-5.6 Sol kommt auf 59 Punkte bei 0,11 US-Dollar und 52 Sekunden. Kimi K3 liegt bei 57 Punkten, 0,04 US-Dollar und 61 Sekunden. Gemini 3.6 Flash erreicht 50 Punkte bei 0,02 US-Dollar und 29 Sekunden pro Aufgabe.
Für die Bewertung nennt die Produktseite mehrere Formate: Q&A mit objektiver Bewertung, Dokumenteingaben und agentische Aufgaben mit Tools. Eine Interaktionsbewertung für simulierte Gespräche ist bereits angekündigt, aber noch als „Coming soon“ markiert. Eigene Agenten lassen sich außerdem per HTTP in denselben Ablauf einbinden.
Damit positioniert Artificial Analysis Optima als Werkzeug für Teams, die Modellvergleiche näher an reale Arbeitsprozesse heranführen wollen. Statt nur Standard-Benchmarks zu betrachten, sollen Unternehmen ihre eigenen Aufgaben definieren, ausführen, bewerten und anschließend die passende Modellwahl auf Basis von Qualität, Kosten und Laufzeit treffen.
Dieser Artikel wurde KI-generiert erstellt. Die Themenauswahl trifft die Redaktion, die redaktionelle Verantwortung liegt bei KI-Prüfstand.