Czy średniak może naprawdę wskoczyć przed flagowce?

Jeden z tańszych modeli wylądował właśnie na drugim miejscu niezależnego rankingu, przed topowym modelem OpenAI.

Poznaj Sonneta 5.5, średni model Anthropica, który wyszedł 28 września. W Artificial Analysis Intelligence Index, czyli mocno obserwowanym, niezależnym rankingu, zajął drugie miejsce. Wynik przy maksymalnym wysiłku to 56 punktów. GPT-6 Sol ma 48, a flagowa Astra od OpenAI 53.

To nie jest jeden wykres. W zestawieniu Vals AI z GPT-6 Sol wygrywa osiemnaście z dziewiętnastu wspólnych testów. W Terminal-Bench 4.0, teście agentowego kodowania, dostał 70,6 procent, a jego poprzednik zaledwie 10,3. Anthropic twierdzi też, że jest ponad 30 procent szybszy niż Sonnet 5 i do 30 procent tańszy w przeliczeniu na zadanie. W teście pracy z prawdziwego świata ma mniej więcej dwa punkty straty do własnego flagowca, Opusa 5.5.

Chwila. Z 10,3 na 70,6? To nie jest ulepszenie, to zupełnie inne zwierzę. Czy to na pewno prawda?

Jeden z recenzentów zwrócił uwagę na to samo: stary wynik wygląda nietypowo nisko, więc skok trzeba traktować orientacyjnie. Do tego niezależny ranking zrobiono na wersji przedpremierowej z błędem przy ustrukturyzowanych odpowiedziach. Anthropic mówi, że poprawił go przed premierą, a wyniki mogły wyjść nawet nieco zaniżone.

Dobrze o tym wiedzieć, ale obraz całości się nie zmienia. Środek stawki wciąż dociska górę, a tym razem wyprzedził ją w rankingu, który ludzie naprawdę śledzą.