Dziesięć razy taniej za token: co to właściwie znaczy?

Model nie będzie zużywał mniej tokenów. Chodzi o coś ciekawszego.

Nvidia powtarza to przy każdej okazji: nowy sprzęt Vera Rubin ma dawać dziesięć razy niższy koszt za token. Brzmi, jakby AI miało za chwilę potanieć dziesięciokrotnie dla wszystkich. No nie do końca.

Trening to jedno, codzienna praca to drugie

Model ma dwa etapy życia. Najpierw trening, czyli jednorazowe, potwornie drogie budowanie. Potem praca, czyli każde pytanie, które ktoś wpisuje, i każda odpowiedź, miliardy razy dziennie, bez końca. Te dziesięć razy dotyczy właśnie tej codziennej pracy. Trening też przyspiesza, ale skromniej, mniej więcej trzy i pół raza.

I to ma sens, bo pieniądze uciekają właśnie tutaj. Model trenujesz raz, a obsługujesz go codziennie dla milionów ludzi.

Tańszy token to nie mniej tokenów

Tu wiele osób się myli. Nowy sprzęt nie sprawia, że model mniej gada. Na to samo pytanie wygeneruje tyle samo tokenów co wcześniej, bo to zależy od modelu, a nie od krzemu. Zmienia się tylko to, ile labo musi zapłacić za wyprodukowanie każdego z nich. Ten sam token, dziesięć razy taniej w produkcji.

To co, mój abonament spadnie do jednej dziesiątej?

Raczej bym na to nie liczył. Oszczędność trafia najpierw do laba, a każdy lab sam decyduje, co z nią zrobi. Jeden obniży ceny, żeby podkraść klientów konkurencji. Drugi po cichu schowa różnicę do kieszeni i wreszcie zacznie zarabiać. A trzeci zrobi coś sprytnego: zostawi cenę bez zmian, za to pozwoli modelowi dłużej myśleć, dłużej pracować jako agent, czytać większe dokumenty. Płacisz tyle samo, a dostajesz dużo więcej roboty.

Czyli sprzęt daje labom górę oszczędności. Ile z tego trafi do ciebie, to już nie fizyka, tylko biznes.