722 prace matematyczne od AI, głównie z jednego prompta. Czy można im ufać?
Wyobraź sobie, że firma wrzuca na GitHuba 722 prace matematyczne i mówi: napisał je model, którego jeszcze wam nie pokazaliśmy. Tak właśnie zrobiło OpenAI. Prace są pogrupowane w 372 rodziny problemów, wybrane z puli około 4000 zadań. Średni koszt jednego wyniku to około trzech godzin mocy obliczeniowej na poziomie ChatGPT Pro. I najciekawsze: prawie wszystko powstało z jednego polecenia dla jednego agenta.
Wśród wyników jest między innymi rezultat dotyczący słynnego problemu Kakeyi w czterech wymiarach oraz słabszy, częściowy wynik wokół hipotezy Riemanna. Słabszy znaczy tyle, że to nie jest dowód tej hipotezy, tylko krok w jej pobliżu.
Problem z Lean
Lean to coś w rodzaju kompilatora dla dowodów: komputer sam sprawdza każdy krok, więc nie musisz nikomu wierzyć na słowo. Około 560 z 722 prac ma taką formalizację. Pozostałych ponad 160 nie ma, a samo OpenAI uczciwie przyznaje, że mogą zawierać błędy.
To przełom czy popis?
Pewnie trochę jedno i drugie. Jeśli te wyniki się obronią, masowa produkcja wyników badawczych z pojedynczych poleceń to coś naprawdę nowego. Ale zespół doradczy z Institute for Advanced Study poprosił o nazwę modelu, dokładne polecenia i moc obliczeniową na każdy problem. OpenAI podało tylko średnie i zaznaczyło, że nie czuje się związane tymi zaleceniami.
A średnie chowają to, co najbardziej chcielibyśmy wiedzieć: ile prób skończyło się niczym? Widzimy 722 prace, które przeszły. Reszty nie widzimy. Można więc być pod wrażeniem i jednocześnie nie zamykać sprawy. Jedno i drugie jest prawdą naraz.