ByteDance, compania-mamă a TikTok, a început pre-antrenarea unui model AI care ar putea ajunge la 10 trilioane de parametri — de trei ori mai mult decât Kimi K3, cel mai mare model produs până acum în China, dezvoltat de rivalul Moonshot AI. Proiectul, realizat de echipa internă de cercetare Seed (circa 2.000 de angajați), folosește 30.000 de GPU-uri, iar doar faza de pre-antrenare ar urma să dureze între trei și șase luni.
Cât de mare e modelul și de ce dimensiunea nu spune tot
Modelul folosește o arhitectură Mixture of Experts (MoE): în loc ca fiecare interogare să treacă prin toți parametrii modelului, un mecanism de rutare activează doar o parte din „experții" specializați din rețea, în funcție de tipul cererii. Practic, cele 10 trilioane de parametri reprezintă dimensiunea totală teoretică a modelului, nu numărul de parametri folosiți efectiv la fiecare răspuns — ceea ce face modelul mult mai eficient de rulat decât ar sugera cifra brută.
Analiștii citați de presa internațională atrag atenția că numărul mare de parametri arată, în primul rând, amploarea infrastructurii și ambițiile ByteDance, nu neapărat un avans real față de concurenții americani precum Anthropic sau OpenAI — performanța finală va depinde de calitatea datelor de antrenare și de arhitectură, nu doar de scară.
De ce ByteDance refuză să „copieze" prin distilare
Cu câteva zile înainte ca planul pentru modelul de 10 trilioane de parametri să devină public, fondatorul ByteDance, Zhang Yiming, le-a transmis angajaților din echipa Seed, într-o întâlnire din iulie, că firma nu va folosi distilarea din modelele concurenților — o tehnică prin care un model mai mic „învață" copiind ieșirile unui model rival, mai puternic — ca metodă de a recupera rapid din decalajul față de rivalii americani. Zhang a recunoscut explicit că ByteDance ar putea rămâne, pe termen scurt, în urma altor companii chineze, dar a insistat că firma trebuie să „sacrifice câștiguri pe termen scurt pentru obiective pe termen lung", pentru a construi capacități tehnologice reale, nu doar rezultate copiate.
Motivul din spatele deciziei nu e doar unul tehnic: potrivit unor surse citate de presa americană, ByteDance vrea să evite o nouă rundă de examinare atentă din partea autorităților de la Washington — exact în perioada în care viitorul TikTok pe piața americană rămâne un subiect politic sensibil. Interdicția vizează însă doar modelele concurenților; ByteDance poate în continuare să folosească distilarea intern, pornind de la propriile modele Seed.
Ce înseamnă asta
Anunțul se înscrie într-o cursă tot mai vizibilă între companiile chineze de AI, care încearcă să recupereze din decalajul față de SUA atât prin infrastructură masivă — GPU-uri, centre de date, modele tot mai mari — cât și, cel puțin în cazul ByteDance, printr-o strategie declarată de a construi propriile capacități „de la zero", nu prin scurtături. Rămâne de văzut, în lunile următoare, dacă un model de 10 trilioane de parametri se traduce și în performanțe reale comparabile cu cele ale liderilor actuali ai pieței.
Fii primul care comentează acest articol!