Czy nowy sprzęt to jedyny sposób, żeby AI było tańsze?

Nvidia pokazuje błyszczącą połowę historii. Druga połowa to cache.

Kiedy Nvidia wychodzi na scenę z nowym potworem i obiecuje dziesięć razy tańsze tokeny, łatwo uwierzyć, że AI tanieje tylko dzięki lepszym chipom. To połowa prawdy. Laby tną koszty jeszcze w inny, dużo cichszy sposób, i nie muszą do tego kupować ani jednej nowej karty.

Sposób pierwszy: tańszy każdy token

To jest droga sprzętowa. Z twoim pytaniem nic się nie dzieje. Model myśli tak samo długo, liczy tak samo dokładnie, pisze tyle samo tokenów. Po prostu każdy z nich kosztuje mniej prądu i mniej pracy maszyny, bo krzem jest lepszy. Czysta inżynieria.

Sposób drugi: nie licz dwa razy tego samego

A teraz sprytniejsza część. Ogromna część tego, co trafia do modelu, to powtórki. Te same długie instrukcje na początku każdego zapytania. Ten sam dokument wklejony do rozmowy, która ciągnie się godzinami. Po co liczyć to wszystko od nowa za każdym razem?

No więc laby przestały. Nazywa się to prompt caching. Jeśli początek zapytania zgadza się z czymś, co model niedawno już przetworzył, korzysta z gotowego wyniku i dolicza tylko nowe kawałki. Na tej powtarzalnej części koszt potrafi spaść nawet o około dziewięćdziesiąt procent.

Chińskie laby, a najbardziej DeepSeek, mocno na tym grały i zrobiły z tanich trafień w cache jeden z głównych punktów swojego cennika. Dziś to już standard także u największych zachodnich graczy. Do tego dochodzi routing: łatwe pytania lądują w małym, tanim modelu, a do drogiego trafiają tylko te naprawdę trudne.

Czyli ten cały nowy sprzęt to w sumie mniej ważna sprawa?

Wręcz przeciwnie, i tu jest najfajniejsze. Te dwie oszczędności się nie sumują, tylko mnożą. Sprzęt sprawia, że każdy token jest tańszy. Cache sprawia, że od zera trzeba policzyć dużo mniej tokenów. Lab, który ma jedno i drugie, dostaje oszczędność razy oszczędność. Dlatego to słynne „dziesięć razy” od Nvidii to tylko kawałek obrazka. Najtaniej będą działać ci, którzy pociągną za obie wajchy naraz.