722 prace matematyczne od AI, głównie z jednego prompta. Czy można im ufać?

OpenAI wrzuciło setki matematycznych wyników napisanych przez model. Skala robi wrażenie, dowodów poprawności jest mniej.

Wyobraź sobie, że firma wrzuca na GitHuba 722 prace matematyczne i mówi: napisał je model, którego jeszcze wam nie pokazaliśmy. Tak właśnie zrobiło OpenAI. Prace są pogrupowane w 372 rodziny problemów, wybrane z puli około 4000 zadań. Średni koszt jednego wyniku to około trzech godzin mocy obliczeniowej na poziomie ChatGPT Pro. I najciekawsze: prawie wszystko powstało z jednego polecenia dla jednego agenta.

Wśród wyników jest między innymi rezultat dotyczący słynnego problemu Kakeyi w czterech wymiarach oraz słabszy, częściowy wynik wokół hipotezy Riemanna. Słabszy znaczy tyle, że to nie jest dowód tej hipotezy, tylko krok w jej pobliżu.

Problem z Lean

Lean to coś w rodzaju kompilatora dla dowodów: komputer sam sprawdza każdy krok, więc nie musisz nikomu wierzyć na słowo. Około 560 z 722 prac ma taką formalizację. Pozostałych ponad 160 nie ma, a samo OpenAI uczciwie przyznaje, że mogą zawierać błędy.

To przełom czy popis?

Pewnie trochę jedno i drugie. Jeśli te wyniki się obronią, masowa produkcja wyników badawczych z pojedynczych poleceń to coś naprawdę nowego. Ale zespół doradczy z Institute for Advanced Study poprosił o nazwę modelu, dokładne polecenia i moc obliczeniową na każdy problem. OpenAI podało tylko średnie i zaznaczyło, że nie czuje się związane tymi zaleceniami.

A średnie chowają to, co najbardziej chcielibyśmy wiedzieć: ile prób skończyło się niczym? Widzimy 722 prace, które przeszły. Reszty nie widzimy. Można więc być pod wrażeniem i jednocześnie nie zamykać sprawy. Jedno i drugie jest prawdą naraz.