NatureBench prüft KI-Coding-Agenten an Nature-Aufgaben
NatureBench ist ein neuer Benchmark mit 90 wissenschaftlichen Aufgaben aus Nature-Publikationen über sechs Domänen. Die Aufgaben werden über NatureGym in containerisierte Pakete mit Briefing, Datensatz, verborgenem Testset und automatischem Evaluator übersetzt. In der gemeldeten Auswertung von zehn Frontier-Agent-Konfigurationen übertraf das stärkste System den publizierten Stand der Technik nur in 17,8 Prozent der Aufgaben nach dem g>0.1-Kriterium. Die nüchterne Pointe: Agenten reproduzieren Methoden besser, als sie echte wissenschaftliche Sprünge erfinden.
Quelle: huggingface.co
AA-Briefcase misst mehrwöchige Wissensarbeit statt Kurzfragen
Artificial Analysis hat AA-Briefcase vorgestellt, einen Benchmark für realistische Wissensarbeitsprojekte. Bewertet werden komplexe, mehrwöchige Aufgaben mit vielen verknüpften Teilschritten und Tausenden Eingabedateien; kombiniert werden Rubric Pass Rate, Analytical Quality Elo und Presentation Elo. In den veröffentlichten Daten liegt „Claude Fable 5 (with fallback)“ mit einem AA-Briefcase-Elo von rund 1587 vor „Claude Opus 4.8 (max)“ mit rund 1356. Das ist keine akademische Kleinaufgabe mehr, sondern ein Versuch, Agenten dort zu messen, wo Büroarbeit tatsächlich blutet.
Quelle: artificialanalysis.ai