PlanBench-XL testet Agentenplanung über 1.665 Werkzeuge
PlanBench-XL ist ein neuer interaktiver Benchmark für LLM-Agenten in großen Tool-Ökosystemen. Er umfasst 327 Retail-Aufgaben über 1.665 Werkzeuge und prüft, ob Agenten relevante Tools trotz begrenzter Sichtbarkeit finden, Zwischenergebnisse nutzen und bei blockierten oder fehlerhaften Funktionen umplanen. In den gemeldeten Experimenten erreicht GPT-5.4 ohne Blockaden 51,90 Prozent Genauigkeit, fällt unter schwerster Blockade aber auf 11,36 Prozent. Die eigentliche Botschaft ist hässlich-nützlich: Agenten scheitern nicht nur am Denken, sondern am Reparieren ihrer eigenen Arbeitswege.
Quelle: huggingface.co
PhySciBench misst Deep-Research-Agenten in Physik und Chemie
PhySciBench bewertet Deep-Research-Agenten mit 200 expertengeschriebenen Fragen aus Physik und Chemie. Die Aufgaben decken multimodales QA, Long-Context-QA, strukturierte Informationsextraktion, wissenschaftliches Schließen, Versuchsdesign und Codegenerierung ab. Der stärkste gemeldete Baseline-Wert, Gemini Deep Research, erreicht nur 33,5 Prozent Genauigkeit. Das begleitende DelveAgent-Framework verbessert laut Paper die Genauigkeit um bis zu 7,5 Prozentpunkte und senkt die Inferenzkosten auf etwa ein Drittel der stärksten Baseline.
Quelle: huggingface.co