97,6% w FrontierMath Tier 4
Najtrudniejszy poziom matematyki w zestawieniu

W skrócie
64,6%
w Terminal-Bench Science 0.1
Największa przewaga w badaniach w całej tabeli.
59,3%
w Agents' Last Exam
Agent sam wykonuje kolejne kroki, a Astra potrzebowała ich mniej.
41,4%
w AutomationBench
Jeden wiersz tej tabeli bije każdy model Claude.
OpenAI samo opublikowało te liczby, razem z wynikami konkurencji.
Astra wygrywa długie zadania agentowe. W tej samej tabeli są wiersze, w których nadal prowadzi Claude.
Uczciwie o czytaniu wyników: w tekście na tej stronie FrontierMath jest zaokrąglone do 98%. Tabela na tej samej stronie mówi 97,6%. Poszliśmy za tabelą, a vellum.ai podaje tę samą liczbę.
Źródła
- openai.com
- vellum.ai


