Sonnet 5.5 czy GPT-6.1 Sol, kto naprawdę wygrywa?

Wszyscy chcą prostej odpowiedzi. Uczciwa jest bardziej pokręcona i zaczyna się od brakującego porównania.

Wydawałoby się, że to proste. Dwa średnie modele, dzień różnicy, wystarczy porównać wyniki. Tyle że większość zestawień stawia Sonneta 5.5 obok starszego GPT-6 Sol, a nie obok nowego. W starciu z tym starszym Sonnet wygrywa osiemnaście z dziewiętnastu wspólnych testów.

Z nowym Solem materiału jest mniej i jest poszarpany. W AutomationBench, teście wieloetapowych procesów biznesowych, Sonnet 5.5 zdobył 44,7 procent. Nowy Sol dostał od około 32 do 36 procent, zależnie od ustawionego wysiłku. W DeepSWE OpenAI podaje dla nowego Sola 75,2 procent, więcej niż najlepszy wynik Astry, ale potwierdzonej liczby dla Sonneta 5.5, którą dałoby się obok tego postawić, na razie nie ma.

No i cena tego zwycięstwa. Przebieg AutomationBench kosztował przy Sonnecie około 1,14 dolara na zadanie, a przy Solu około 0,30.

To kto wygrywa? Przykro mi, ale to złe pytanie.

Lepsze brzmi: do jakiej roboty go potrzebujesz? Jeśli liczy się najwyższy wynik w szerokiej, długiej pracy umysłowej, przewagę ma Sonnet. Jeśli puszczasz tysiące zadań agentowych i każdy cent gra rolę, cena nowego Sola za zadanie robi wrażenie.

I pamiętaj, że większość liczb nowego Sola pochodzi od samego OpenAI, a każda firma wybiera wykresy, które jej pasują.