Pe 14 iulie 2026, startup-ul PrismML a lansat Bonsai 27B — primul model AI din clasa 27 de miliarde de parametri capabil să ruleze integral pe un telefon. Un model care, în mod normal, ar avea nevoie de 54GB de memorie în format standard FP16, încape acum în doar 3,9GB și rulează local pe un iPhone 17 Pro. Lansarea a venit chiar în săptămâna în care CNBC a dezvăluit că Apple se află în discuții cu PrismML — motiv suficient ca modelul să atragă atenția întregii industrii AI.

Cine e PrismML

PrismML a ieșit din stealth pe 31 martie 2026, cu 16,25 milioane de dolari finanțare de tip seed de la Khosla Ventures și Cerberus Ventures, plus granturi de calcul de la Google și Caltech. Compania, cu sediul în Pasadena, California, a fost fondată în 2025 și se bazează pe cercetare și proprietate intelectuală provenind de la Caltech (California Institute of Technology) — care deține brevetele de bază și le licențiază exclusiv către PrismML. CEO-ul e Babak Hassibi, profesor la Caltech, alături de o echipă de conducere formată din Sahin Lale și Omead Pooladzandi (co-șefi de cercetare) și Reza Sadri (VP Strategie).

Cum a fost comprimat modelul — antrenare nativă în 1-bit, nu conversie ulterioară

Bonsai 27B pornește de la Qwen3.6-27B, modelul open-source multimodal al Alibaba (~24,8 miliarde parametri de limbaj, 0,46 miliarde turn vizual, 2,5 miliarde embeddings), cu fereastră de context de 262.000 de tokeni. Arhitectura de bază rămâne neschimbată — ce diferă e felul în care sunt reprezentate ponderile modelului.

Diferența esențială față de majoritatea modelelor „cuantizate” (comprimate după antrenare): PrismML a antrenat Bonsai 27B nativ cu constrângerea de biți redusă încă din prima etapă (Quantization-Aware Training / QAT), aplicată capăt la capăt — pe embeddings, straturi de atenție și blocuri MLP deopotrivă. Practic, modelul „învață” direct să funcționeze bine cu reprezentări ultra-comprimate, nu e doar rotunjit după ce a fost deja antrenat la precizie completă.

Trei variante, de la precizie completă la 1-bit

VariantăBiți/pondereDimensiunePerformanță vs. FP16
FP16 (referință)16~54 GB100%
Ternar ({-1, 0, +1})1,715,9 GB94,6%
1-bit ({-1, +1})1,1253,9 GB89,5%

Metoda de compresie: fiecare pondere devine un „cod” binar sau ternar, cu un singur factor de scală comun (în FP16) pentru fiecare grup de 128 de ponderi — de-asta 1-bit-ul ajunge la 1,125 biți efectivi per pondere, nu exact 1. Raportul de compresie față de FP16: aproape 14,2x pentru varianta 1-bit.

Benchmark-uri detaliate — unde pierde cel mai mult performanța comprimată

CategorieFP16Ternar1-bit
Matematică (AIME)95,3393,4091,66
Programare88,7485,9681,88
Cunoștințe/raționament83,1576,9673,39
Task-uri agentice80,0074,0166,03
Urmărire instrucțiuni78,4771,7765,74
Vizual (multimodal)72,6165,1959,57

Tiparul e clar: matematica rezistă cel mai bine la compresie (doar -3,7 puncte pe varianta 1-bit), în timp ce task-urile agentice și urmărirea instrucțiunilor pierd cel mai mult (peste 14 puncte). Practic, pentru raționament pur, compresia extremă afectează puțin; pentru sarcini care cer nuanțe fine de interpretare a cerințelor, diferența se simte mai clar.

Performanță reală pe dispozitive

Pe un iPhone 17 Pro, varianta 1-bit rulează la aproximativ 11 tokeni pe secundă — suficient pentru o conversație text în timp aproape real, deși departe de viteza unui API cloud. Pe hardware desktop mai puternic, cum e un Mac cu chip M5 Max, varianta binară atinge 66,4 tokeni/secundă la generare și 874 tokeni/secundă la procesarea promptului inițial. Din cei 64 de straturi ale modelului, doar 16 mai păstrează un cache de atenție complet (restul folosesc atenție liniară), ceea ce reduce drastic memoria necesară pentru contexte lungi: fereastra completă de 262K tokeni ar necesita 17,2GB în FP16, dar doar 4,3GB în format cuantizat pe 4-bit.

Licențiere și disponibilitate

Toate variantele Bonsai 27B sunt disponibile gratuit sub licență Apache 2.0, pe Hugging Face (colecția prism-ml), rulabile prin llama.cpp (CUDA, Metal) sau MLX pentru dispozitivele Apple. Varianta ternară e disponibilă și ca API găzduit prin Together AI, pentru cine vrea să testeze fără să descarce modelul local.

Apple, în discuții cu PrismML — dar „foarte devreme”, spune CEO-ul

Chiar înainte de lansarea Bonsai 27B, CNBC a raportat că Apple evaluează tehnologia PrismML, testând viteza, eficiența energetică și performanța pe dispozitive proprii. Contactat de CNBC, CEO-ul Babak Hassibi a descris discuțiile drept „foarte incipiente”, adăugând că „nu e clar încă unde vor duce”, dar că „lucrurile evoluează frumos”. Apple a refuzat să comenteze. Natura exactă a unei eventuale înțelegeri — achiziție, licențiere sau doar parteneriat tehnic — rămâne necunoscută, iar unele publicații (Wccftech) au observat sec că, dacă discuțiile ar fi cu adevărat avansate, CEO-ul unui startup rareori le-ar face publice.

Contextul contează: Apple Intelligence și Siri au trecut recent printr-o restructurare majoră, cu integrarea Gemini și Claude direct în Siri. Un model de dimensiunea Bonsai 27B, care rulează integral pe dispozitiv fără conexiune la cloud, s-ar potrivi exact cu miza pe intimitate/procesare locală pe care Apple o tot repetă în comunicarea despre Apple Intelligence.

Ce înseamnă practic

Bonsai 27B nu e cel mai capabil model AI disponibil azi — un Claude sau GPT rulat în cloud, la precizie completă, rămâne net superior pe majoritatea sarcinilor. Ce demonstrează, în schimb, e că un model de 27 de miliarde de parametri — o clasă de mărime rezervată până acum serverelor — poate rula complet local, offline, pe un telefon de buzunar, păstrând aproape 90% din capacitate. Pentru un utilizator obișnuit, asta înseamnă asistenți AI care funcționează fără semnal, fără să trimită date către niciun server, și fără costuri de abonament API — exact tipul de argument care ar putea explica interesul Apple.

🤖 Inteligență Artificială
← Toate articolele
💬 Comentarii

Fii primul care comentează acest articol!

✍️ Lasă un comentariu
7 + 4 = ?