Wszystkie wpisy

Modele AI

97,6% w FrontierMath Tier 4

Najtrudniejszy poziom matematyki w zestawieniu

Sam Altman at TED
Zdjęcie: Sam Altman at TED, by Steve Jurvetson, CC BY 2.0 (via Wikimedia Commons), background removed

W skrócie

  • 64,6%

    w Terminal-Bench Science 0.1

    Największa przewaga w badaniach w całej tabeli.

  • 59,3%

    w Agents' Last Exam

    Agent sam wykonuje kolejne kroki, a Astra potrzebowała ich mniej.

  • 41,4%

    w AutomationBench

    Jeden wiersz tej tabeli bije każdy model Claude.

OpenAI samo opublikowało te liczby, razem z wynikami konkurencji.

Astra wygrywa długie zadania agentowe. W tej samej tabeli są wiersze, w których nadal prowadzi Claude.

Uczciwie o czytaniu wyników: w tekście na tej stronie FrontierMath jest zaokrąglone do 98%. Tabela na tej samej stronie mówi 97,6%. Poszliśmy za tabelą, a vellum.ai podaje tę samą liczbę.

Źródła

  • openai.com
  • vellum.ai
UdostępnijNa FacebookuTen wpis na Instagramie

Więcej z kategorii: Modele AI