Isti dobavljači rade za OpenAI i Kinu: Silicijska dolina pomaže kineskoj umjetnoj inteligenciji

Isti startupovi iz Silicijske doline koji opskrbljuju OpenAI, Anthropic i američku saveznu vladu skupovima podataka za treniranje umjetne inteligencije istodobno ih prodaju i kineskim AI laboratorijima, koji razvijaju jeftinije modele sposobne konkurirati njihovim američkim klijentima.
Kada su prodajni timovi američkih startupova iz Silicijske doline, specijaliziranih za označavanje podataka (data labeling), ove godine posjetili Međunarodnu konferenciju o strojnom učenju (International Conference on Machine Learning – ICML) u Seulu, stigli su spremni privući najveće potrošače u industriji. Te tvrtke za podatke – koje zajedno vrijede desetke milijardi dolara i ostvaruju milijarde dolara godišnjeg prihoda isporučujući podatke za treniranje klijentima poput OpenAI-ja i Anthropica – navikle su raditi s AI laboratorijima koji su poznati po tome da su iznimno zahtjevni, nepredvidivi i teško zadovoljivi. No ondje ih je dočekao još jedan zainteresirani kupac: kineska AI industrija.
Neke kineske tvrtke dolaze s vrlo konkretnim popisima želja. Tencent – kojeg je američka vlada ranije označila kao tvrtku povezanu s kineskom vojskom, što kompanija osporava – potencijalnim je dobavljačima distribuirao detaljan zahtjev za podacima za treniranje koji obuhvaćaju financije, kibernetičku sigurnost i jedan od najpoželjnijih ciljeva AI istraživanja: sustave umjetne inteligencije sposobne za vlastito unaprjeđivanje.
SAD ograničava čipove, ali ne i izvoz znanja
Dok Sjedinjene Države već dugo zabranjuju Kini kupnju naprednih čipova koji pokreću najbolje američke AI modele, nisu poduzele iste mjere kada je riječ o podacima potrebnima za njihovo treniranje. Ta “zapakirana” ljudska stručnost, nastala kroz mreže specijaliziranih stručnjaka te oblikovana dizajnom zadataka, kriterijima ocjenjivanja i kontrolom kvalitete, dio je skupe podatkovne infrastrukture koja modele uči obavljati složene profesionalne zadatke poput financijskog modeliranja i programiranja. To je posao vrijedan stotine milijuna dolara godišnje i pomaže kineskim AI modelima da smanje zaostatak za američkim konkurentima.
“Nakon računalne snage potrebne za treniranje modela, kvalitetni podaci su najvažniji čimbenik”, rekao je za Forbes Nathan Lambert, bivši istraživač u Allen Institute for AI. “Kako pokušavamo modele dovesti u nova i zahtjevnija područja, kvalitetni podaci predstavljaju najveću polugu koja može učiniti model doista korisnim.”
Isti dobavljači opskrbljuju i OpenAI i kineske AI laboratorije
Dokumentacija i komunikacija između kupaca iz kineskih AI laboratorija te zaposlenika vodećih platformi za označavanje podataka iz Silicijske doline, poput Surge AI-ja i Mercora, koje je pregledao Forbes, otkrivaju tihu trgovinu skupovima podataka za treniranje vrijednu više stotina milijuna dolara. Isti američki startupovi koji opskrbljuju OpenAI, Anthropic, a u nekim slučajevima i američke savezne institucije, istodobno opskrbljuju i vodeće laboratorije u Pekingu. Sve više se pokazuje da Silicijska dolina trenira obje strane utrke u naoružavanju umjetnom inteligencijom.
Tri načina na koja Kina sustiže američke AI modele
Za kineske AI laboratorije koji žele dostići američke performanse postoje tri glavna prečaca. Prvi je privlačenje vrhunskih istraživača iz konkurentskih organizacija. Drugi je destilacija – prikupljanje odgovora sustava poput ChatGPT-a ili Claudea i njihovo korištenje za treniranje kineskih modela. Iako nije nezakonita, ta praksa izričito krši uvjete korištenja OpenAI-ja i Anthropica, a nedavno ju je kritizirao i savjetnik administracije Donalda Trumpa za znanost i tehnologiju Michael Kratsios. Treći je put jednostavniji i bez mogućih regulatornih problema: kupiti iste podatke za treniranje koje kupuju američki AI laboratoriji – od istih dobavljača.
Prava vrijednost nije u podacima, nego u stručnom znanju
Poučavanje AI modela da rješava složene računovodstvene zadatke ili laboratorijske protokole ne svodi se samo na prikupljanje gotovih rezultata rada. Prava vrijednost krije se u specifikacijama podataka: koje vrste podataka koristiti te u detaljnim kriterijima koje izrađuju stručnjaci kako bi model naučio snalaziti se u poslovima koji zahtijevaju visoku razinu znanja. Kupnjom takvih skupova podataka kineski laboratoriji zapravo kupuju teško stečeno i vlasničko znanje koje pokreće najbolje modele iz Silicijske doline.
Sean Cai, konzultant za AI podatke i autor istoimenog bloga o podacima i potkrepljujućem učenju (reinforcement learning), to sažima ovako: “Ako proučite strukturu industrije podataka u Kini i cijeli lanac opskrbe podacima, shvatit ćete da se velik dio istih američkih podataka koji pokreću napredak američkih modela prodaje i kineskim laboratorijima.”
Od Silicijske doline do kineskih tehnoloških divova
Taj lanac vodi izravno od američkih tvrtki za označavanje podataka do najvećih kineskih tehnoloških divova, uključujući Tencent, kojeg je Pentagon označio kao tvrtku povezanu s kineskom vojskom.
U jednoj poruci koju je vidio Forbes, izvršni direktor zadužen za nabavu podataka u Tencentu naveo je da se tvrtka oslanja na Surge AI – čiji su klijenti bili američka kopnena vojska, ratno zrakoplovstvo i Anthropic – za isporuku podataka. Mercor, koji je krajem prošlog mjeseca zaposlenicima objavio da je dobio ugovor s američkom saveznom vladom, također surađuje s Tencentom.
Druga komunikacija koju je pregledao Forbes pokazuje slična preklapanja. U tekstualnim porukama izvršni direktor Ant Groupa, kineske tehnološko-financijske tvrtke koja stoji iza Alipaya, potvrdio je blisku suradnju s američkom tvrtkom AfterQuery. Audiozapisi razgovora sa zaposlenikom Alibabe upućuju na ugovore o kupnji podataka od AfterQueryja i Mercora. Interna projektna dokumentacija sugerira da je američki startup Turing surađivao s ByteDanceom, kineskom matičnom tvrtkom TikToka.
Tvrtke ne žele otkrivati s kim posluju
ByteDance, Alibaba, Moonshot, Tencent i Ant Group nisu odgovorili na zahtjeve za komentar, dok je Mercor odbio komentirati. AfterQuery i Surge AI izjavili su da ne otkrivaju informacije o klijentima.
Turing je u priopćenju naveo: “Podržavamo najnaprednije AI sustave, uključujući vlasničke i modele otvorenog koda. Vjerujemo da će obje kategorije nastaviti rasti, a neki od najboljih open-source modela danas dolaze iz laboratorija izvan SAD-a.”
Kineski laboratoriji godišnje troše oko 500 milijuna dolara
Prema dvojici poduzetnika iz industrije označavanja podataka koji su dobili procjene tržišta od rukovoditelja Tencenta i ByteDancea, šest najvećih kineskih AI laboratorija zajedno godišnje troši oko 500 milijuna dolara na američke tvrtke za označavanje podataka.
Prema riječima osobe koja surađuje s više takvih laboratorija, kineski AI laboratoriji ne smatraju se međusobnim konkurentima u nabavi, već djeluju kao zajednička skupina kupaca u potrazi za najboljim zapadnim skupovima podataka.
Američke tvrtke rado prodaju kineskim kupcima
Američke tvrtke za označavanje podataka rado im prodaju svoje usluge. Prema izvoru upoznatom sa situacijom, u drugom tromjesečju Mercor je ostvario 2 % ukupnog prihoda od kineskih AI laboratorija (njegov godišnji prihod u lipnju premašio je dvije milijarde dolara), a tvrtka je zaposlila posebnog voditelja za kinesko tržište.
Znatno veći dio poslovanja AfterQueryja – najmanje 50 milijuna dolara ponavljajućih prihoda – dolazi upravo od kineskih AI laboratorija, rekli su izvori za Forbes. Surge AI, jedan od pionira na tom tržištu, aktivno je tražio kineske kupce, a izvršni direktor Edwin Chen putovao je u Kinu kako bi se osobno sastao s čelnicima laboratorija.
Zašto su OTS skupovi podataka toliko vrijedni?
Tvrtke za označavanje podataka kineskim AI laboratorijima prodaju prilagođene projekte, ali i takozvane “Off-the-Shelf” (OTS) skupove podataka – standardizirane, unaprijed pripremljene skupove za treniranje namijenjene višekratnoj prodaji različitim laboratorijima.
Na prvi pogled to zvuči bezazleno, ali OTS skupovi podataka nisu nimalo bezopasni. Nastaju koristeći iste “knowledge pipelines” razvijene tijekom rada za OpenAI ili Anthropic. To znači da kineske tvrtke koje ih kupe dobivaju pristup istim mrežama doktora znanosti, algoritmima za kontrolu kvalitete i kriterijima za dodatno treniranje koji pomažu u razvoju vodećih američkih AI modela.
To je golema prednost. U mnogim slučajevima kineski laboratoriji mogu preskočiti mjesece pokušaja i pogrešaka kupnjom OTS skupova podataka koji već sadrže provjerene obrasce zaključivanja.
“Morate shvatiti da oblik tih podataka ponekad dolazi iz istih tvrtki koje su razvile početne strategije skaliranja za Anthropic. Dobavljaču koji je radio za Anthropic izuzetno je lako koristiti isti tehnološki okvir za proizvodnju podataka za kineski laboratorij”, objasnio je Cai.
Najprofitabilniji proizvod u industriji
Zbog toga su OTS skupovi podataka iznimno privlačni dobavljačima – mogu se prodavati više puta različitim AI laboratorijima, pa ostvaruju najveće profitne marže. Štoviše, kineski AI laboratoriji američkim dobavljačima otvoreno govore da žele kupiti sve podatke koje su američki laboratoriji već kupili, rekao je jedan izvršni direktor koji je s njima razgovarao.
Max Gazor, osnivač investicijskog fonda Striker VC, koji je ulagao u brojne američke AI startupove, priznaje da takva tržišna stvarnost otvara etička pitanja.
“Rekao bih da je to prije svega etička odluka – hoće li tvrtka prodavati podatke kineskim AI kompanijama ili neće.”
Izvoz čipova je ograničen, ali izvoz stručnosti nije
Washington je godinama gradio geopolitičku utvrdu oko naprednih računalnih čipova. Međutim, ljudsko znanje potrebno za treniranje umjetne inteligencije prelazi granice gotovo bez ikakvog nadzora.
To je pomoglo vodećim platformama za podatke iz Silicijske doline da postanu kompanije vrijedne više milijardi dolara. Mercor, osnovan 2023., trenutačno cilja procjenu vrijednosti od 20 milijardi dolara, dok se procjenjuje da Surge AI vrijedi najmanje 25 milijardi dolara. U međuvremenu je relativno novi AfterQuery u samo tri mjeseca narastao sa 100 milijuna na nekoliko stotina milijuna dolara godišnjih ponavljajućih prihoda.
Iako većina prihoda i dalje dolazi od velikih američkih klijenata, međunarodna prodaja predstavlja vrlo privlačan dodatni izvor zarade.
Pitanje nacionalne sigurnosti ili slobodnog tržišta?
Neki smatraju da je prodaja skupova podataka Kini pitanje nacionalne sigurnosti.
“Neke tvrtke koje se bave ljudskim podacima surađuju sa stranim protivnicima, a rezultate danas vidimo u modelu Kimi K3”, napisao je na platformi X Ali Ansari, 25-godišnji izvršni direktor tvrtke Micro1.
“Vjerujemo da je sramotno govoriti o američkoj dominaciji u umjetnoj inteligenciji, a istodobno prodavati milijune dolara vrijedne podatke državama s kojima smo u geopolitičkom suparništvu.”
Micro1 tvrdi da svoje podatke ne prodaje izvan SAD-a. Scale AI također je razmatrao ugovor s ByteDanceom, ali ga je 2024. odustao zbog zabrinutosti za nacionalnu sigurnost.
Protivnici zabrane upozoravaju na posljedice
Branitelji takve prakse tvrde da bi ograničavanje prodaje podataka ugušilo globalne inovacije u području otvorenog koda.
“Nije lako ograničiti izvoz podataka ili umjetne inteligencije, a da se pritom ozbiljno ne našteti američkom open-source ekosustavu”, rekao je Cai, naglasivši da osobno nema čvrst stav o tom pitanju.
“Time bi se stvorio nepravedan duopol OpenAI-ja i Anthropica, a i to nosi vlastite probleme.”
Anna Tong, novinarka Forbes (link na originalni članak)