Close Menu
Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Ultimi Articoli
    Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.

    Vercel fx, un agente di coding da 6 MB in Zig

    24/08/2026
    ASRock B850M Challenger WiFi

    ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

    24/08/2026
    Ox Alpha

    Ox Alpha, il modello anonimo che tutti stanno provando gratis

    22/08/202637 Views
    scrcpy

    scrcpy: controllare Android dal PC senza root e senza spendere

    22/08/202626 Views
    Proton Mail marketing graphic showing a mobile inbox with Primary, Promotions, Updates tabs on a purple gradient background and 'Mail update' label on the left panel.

    Proton Mail introduce le categorie automatiche per organizzare la posta in arrivo

    21/08/202618 Views
    Black-and-white rust-streaked background with a circular gear housing a bold 'R' logo and the text 'RUST 1.98' beneath.

    Rust 1.98 è disponibile: tutte le novità sui calcoli in virgola mobile

    21/08/2026
    Cardpocalypse

    Cardpocalypse, duelli tra carte e nostalgia in salsa cartone animato

    20/08/2026
    Desk scene with glowing cables and overlaid GitHub and Cursor logos, centered on the workbench surface.

    Cursor lancia Origin, la sua alternativa a GitHub

    20/08/2026
    lunedì 24 Agosto 2026
    X (Twitter) Threads Mastodon Bluesky WhatsApp
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    • Home
    • Computer
      1. MINI PC
      2. Laptop
      3. Monitor
      4. Teoria
      5. Mouse
      6. GPU
      7. Windows
      8. Motherboard
      9. Tastiere
      10. View All
      NiPoGi E3B

      Mini PC NiPoGi E3B con Ryzen 7 5700U: potenza compatta ad un prezzo aggressivo

      26/03/2026

      GEEKOM A5: mini pc con buone prestazioni grazie all’AMD Ryzen 7 5800H

      26/03/2026
      Geekom A8

      Recensione Geekom A8: il mini PC AMD che non ti aspetti

      11/03/2026
      ACEMAGICIAN S3A

      ACEMAGICIAN S3A: un mini pc per il gaming ma non solo

      09/03/2026
      Slim silver ASUS Vivobook laptop open on a pastel yellow/blue abstract background.

      ASUS Vivobook Go 15, il notebook essenziale

      07/08/2026
      MacBook Neo

      MacBook Neo, il portatile entry-level di Apple

      30/03/2026
      Galaxy Book5 Pro

      Il Samsung Galaxy Book5 Pro sfida il MacBook su qualità e autonomia

      18/03/2026
      Lenovo Chromebook Duet 11

      Lenovo Chromebook Duet 11, un versatile 2-in-1 con 10 anni di aggiornamenti

      24/12/2025
      TCL27C2A

      TCL 27C2A: 1.196 zone di local dimming, il QD-Mini LED che cambia le regole del 4K

      13/07/2026
      Asus VA279QG

      ASUS VA279QG, monitor 27″ per lavoro, svago e gaming

      20/06/2026

      ASUS ROG Strix XG27AQNGV, il monitor per i competitive gamer

      05/05/2026

      Philips Evnia 27M2N6501L: il miglior monitor QD-OLED sotto i 500 euro per gaming e color grading

      14/04/2026
      Immich 3.0

      Immich 3.0, cosa cambia per chi gestisce la propria libreria fotografica

      03/07/2026
      Immich

      Immich: accelerazione GPU, ricerca CLIP multilingua e External Library

      09/05/2026
      uv astral

      Il tooling Python è sempre stato un disastro. uv risolve tutto in un colpo solo

      04/05/2026

      Mise-en-place sta cambiando il modo di gestire gli ambienti di sviluppo

      01/05/2026
      Acer wireless mouse with USB dongle on a festive gradient blue background with a gold balloon and colorful confetti pieces nearby.

      Acer, il mouse wireless ergonomico per l’uso quotidiano

      19/08/2026

      Logitech Mobi Fold è il mouse pieghevole per chi viaggia

      11/06/2026

      Logitech G Pro X2 Superstrike, il mouse con tecnologia HITS per click più veloci

      10/02/2026
      Mouse NZXT Lift 2

      Mouse NZXT Lift 2, mouse filare ultraleggero e preciso

      21/12/2025
      rtx spark

      Con RTX Spark, NVIDIA reinventa il PC Windows

      08/06/2026
      MatX

      MatX raccoglie 500 milioni di dollari per sfidare Nvidia

      25/02/2026
      nvidia rtx 5090 ti

      Nvidia prepara una RTX 5090 “estrema” per il 2026

      09/02/2026
      dlss45 MFG 6× nvidia

      NVIDIA dynamic MFG e MFG 6×: più intelligenza per i frame generati

      06/02/2026
      OptimizerDuck

      Ottimizzare Windows senza rischi con optimizerDuck

      04/08/2026
      Colorful floating Office app icons (Word, Excel, PowerPoint, Outlook) on a light blue background.

      Windows 10 ancora protetto e gratis fino a ottobre 2027

      26/06/2026
      winget configuration

      WinGet Configuration configura Windows da zero con un solo comando

      02/06/2026
      Windhawk

      Windhawk: il marketplace di mod che modella Windows 11 a tuo piacere

      28/05/2026
      ASRock B850M Challenger WiFi

      ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

      24/08/2026

      Arduino UNO Q raddoppia RAM e storage

      23/01/2026
      ROG Strix B860-A Gaming

      Asus ROG Strix B860-A Gaming WiFi, motherboard per build ad alte prestazioni.

      17/01/2026
      pcie 250watt

      Asus alimenta una RTX 5060 Ti da 250 W su uno slot PCIe potenziato

      23/09/2025
      Epomaker G84 HE

      Recensione tastiera gaming Epomaker G84 HE

      18/08/2026
      Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

      Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

      27/07/2026
      Epomaker HE75 V2

      Epomaker HE75 V2, il magnetico smette di essere una promessa

      20/06/2026

      Light Mount di be quiet! porta il silenzio nel gaming

      04/02/2026
      Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.

      Vercel fx, un agente di coding da 6 MB in Zig

      24/08/2026
      ASRock B850M Challenger WiFi

      ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

      24/08/2026
      Proton Mail marketing graphic showing a mobile inbox with Primary, Promotions, Updates tabs on a purple gradient background and 'Mail update' label on the left panel.

      Proton Mail introduce le categorie automatiche per organizzare la posta in arrivo

      21/08/2026
      Black-and-white rust-streaked background with a circular gear housing a bold 'R' logo and the text 'RUST 1.98' beneath.

      Rust 1.98 è disponibile: tutte le novità sui calcoli in virgola mobile

      21/08/2026
    • Tech
      1. Curiosità
      2. Eventi
      3. memory cards
      4. Powerbank
      5. Smartwatch
      6. Gadgets
      7. Bluetooth speakers
      8. Intelligenza artificiale
      9. Offerte
      10. Software
      11. View All

      Starlink abbassa i satelliti per sicurezza orbitale

      02/01/2026

      Con Nano Banana, Gemini supera ChatGPT tra le app AI

      17/09/2025
      grotta lunare

      Scoperta una grotta lunare sotterranea

      16/07/2024
      Oleg Kononenko

      Oleg Kononenko: 1000 giorni nello spazio

      05/06/2024

      Dataland, il primo museo di arte AI al mondo apre a LA

      19/06/2026
      Google I/O 2026

      La conferenza Google I/O 2026 sarà a maggio

      18/02/2026

      NASA rinvia Artemis II per perdite di idrogeno

      03/02/2026
      BYD YangWang U9 Extreme

      BYD YangWang U9 Extreme: il nuovo re della velocità tra le auto di serie

      24/09/2025
      SSD Crucial P310 2TB

      Crucial P310 2TB SSD NVMe: storage ad alta velocità a un ottimo prezzo

      08/06/2025
      V-NAND QLC Samsung

      Il futuro dello storage è pronto: Samsung svela la V-NAND QLC da 1 Tb

      12/09/2024
      microSD SD Express

      Samsung presenta la prima microSD SD Express

      07/03/2024

      ADATA lancia il primo SSD esterno USB4 SE920

      31/10/2023
      Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

      Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

      24/07/2026
      power bank

      Power Bank cablati e wireless Qi2 : guida all’acquisto

      03/03/2026

      Anker Nano Power Bank 5K, il caricatore più sottile con MagSafe e Qi2

      22/01/2026
      Sharge ICEMAG 2

      Sharge ICEMAG 2: power bank Qi2 15W con raffreddamento attivo

      12/05/2025
      Black smartwatch with circular dial hovering above a metallic display plinth in a studio setting, showcasing its features.

      Honor Watch 6, lo smartwatch che dura settimane

      03/08/2026
      Smartwatch close-up showing a globe dial with white 09 and orange 30 on a black background with orange accents.

      OPPO Watch X3, lo smartwatch Android resistente e autonomo

      16/07/2026
      Xiaomi Watch S5

      Xiaomi Watch S5, il nuovo smartwatch in acciaio e con autonomia record

      19/06/2026

      Xiaomi Redmi Watch 6, a meno di 100 euro fa cose che non ti aspetti

      12/06/2026
      Futuristic game controller with glowing RGB ring lights, floating in an abstract, swirling background.

      EasySMX X15, il controller economico a effetto Hall

      11/08/2026
      Hue Bridge Pro

      Philips Hue Bridge Pro: novità e prestazioni del nuovo hub smart

      03/07/2026

      Blink Outdoor 4 è in offerta adesso, sorveglianza esterna senza abbonamento cloud

      22/06/2026

      WiiM Sound Lite: speaker Wi-Fi perfetto per l’audio domestico

      11/05/2026

      JBL Xtreme 3, altoparlante potente e impermeabile

      19/05/2026

      JBL Boombox 4: speaker Bluetooth con AI e USB-C lossless

      18/05/2026
      JBL Clip 5

      JBL Clip 5, lo speaker Bluetooth ultra-portatile e suono potente

      16/05/2026
      Marshall Emberton III

      Marshall Emberton III: il re portatile del suono rock

      15/05/2026
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026
      Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.

      Vercel fx, un agente di coding da 6 MB in Zig

      24/08/2026
      Ox Alpha

      Ox Alpha, il modello anonimo che tutti stanno provando gratis

      22/08/2026
      Minimax Music 3

      MiniMax Music 3: pesi aperti e fino a cinque minuti di canzone sul tuo pc

      19/08/2026
      Ultimate Ear Wonderboom 3

      Ultimate Ears WONDERBOOM 3: suono di qualità a un prezzo accessibile

      24/03/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      nubia z60 ultra

      Offerte Black Friday Nubia: telefoni premium a prezzi convenienti

      22/11/2024
      Scream Fest 2024

      Steam Scream Fest 2024: sconti horror per Halloween

      29/10/2024
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026
      scrcpy

      scrcpy: controllare Android dal PC senza root e senza spendere

      22/08/2026
      portmaster

      Chi contatta chi sul tuo computer? Portmaster te lo mostra e se vuoi te lo blocca

      10/08/2026
      Kanata

      Kanata dà i layer di QMK a qualsiasi tastiera, anche a quella del portatile

      08/08/2026
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026
      Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.

      Vercel fx, un agente di coding da 6 MB in Zig

      24/08/2026
      Ox Alpha

      Ox Alpha, il modello anonimo che tutti stanno provando gratis

      22/08/2026
      Desk scene with glowing cables and overlaid GitHub and Cursor logos, centered on the workbench surface.

      Cursor lancia Origin, la sua alternativa a GitHub

      20/08/2026
    • Mobiles
      1. Smartphones
      2. View All
      Lavender smartphone with a triple-camera back and a stylus hovering beside it on a soft abstract background.

      Galaxy A37, il medio di gamma Samsung che convince

      06/07/2026
      Honor 400 Pro

      Honor 400 Pro: hardware da top di gamma con aggiornamenti fino al 2031

      03/07/2026
      Motorola Razr 70

      Motorola Razr 70, il pieghevole compatto ed elegante

      01/07/2026

      RedMagic 11S Pro, tanta potenza e autonomia per il re degli smartphone da gioco

      23/06/2026
      Tablet angled against a pastel wavy background, screen showing bright overlapping colorful circles in blue, pink, yellow.

      iPad 11, il tablet più accessibile di Apple

      08/08/2026
      Tablet with black frame displaying colorful abstract wallpaper, shown front and back against an orange–purple gradient background.

      TCL Tab A1 Plus, il tablet economico per streaming, lettura e produttività leggera

      04/08/2026
      Google Apple

      Google Health 5.05 porta la sincronizzazione bidirezionale con Apple Salute

      04/08/2026
      Oppo 5 Pad

      OPPO Pad 5, un tablet Android pensato per studio, lavoro e intrattenimento quotidiano

      29/07/2026
    • Musica
      1. Cuffie
      2. DAC
      3. hi-fi
      4. Teoria
      5. View All
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Two wireless over-ear headphones, one black and one light gray, displayed on a blue gradient backdrop for product showcase.

      Sennheiser Momentum 5, il nuovo wireless con suono caldo e naturale

      30/06/2026
      Truthear KeyX

      Truthear KeyX, un DAC dongle che vale ogni centesimo

      28/04/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      FiiO BTR15

      FiiO BTR15: DAC Bluetooth al prezzo più basso di sempre

      17/05/2025

      Edifier R1280DBs, ottimi diffusori da scaffale economici

      20/06/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      Focal Aria 926

      Componenti per un ottimo impianto stereo

      31/07/2024
      truffa phishing zalando

      Truffa phishing: in regalo la gift card Zalando da 150€

      06/12/2024
      sim ed esim

      Differenza tra SIM fisica ed eSIM: vantaggi e sicurezza

      02/11/2024

      Malware: cosa sono e come difendersi

      19/10/2024
      crittografia a cosa serve

      Crittografia, come funziona e perchè dobbiamo utilizzarla

      16/10/2024
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Two wireless over-ear headphones, one black and one light gray, displayed on a blue gradient backdrop for product showcase.

      Sennheiser Momentum 5, il nuovo wireless con suono caldo e naturale

      30/06/2026
    • Lifestyle
      1. Criptovalute
      2. EV
      3. Gaming
      4. Trekking
      5. Scienze
      6. View All
      Alpha Arena : trading ai bot

      Alpha Arena : sfida tra modelli AI nel trading di criptovalute

      20/10/2025
      Coinbase

      Coinbase colpita da attacco informatico e minaccia di riscatto

      15/05/2025
      coinbase

      Coinbase : acquisti cripto tramite Apple Pay

      03/12/2024
      criptovalute

      Criptovalute: cosa sono e come funzionano le monete virtuali

      19/10/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
      tesla

      Tesla dice addio a Model S e Model X ma accelera sugli EV autonomi e i robot umanoidi

      29/01/2026
      Volvo EX60

      Volvo EX60: la sfida scandinava al dominio tedesco degli elettrici premium

      22/01/2026
      Cardpocalypse

      Cardpocalypse, duelli tra carte e nostalgia in salsa cartone animato

      20/08/2026
      Caravan SandWitch

      Caravan SandWitch, l’avventura senza combattimenti di Studio Plane Toast

      13/08/2026
      Beacon Pines

      Beacon Pines, il romanzo interattivo di Hiding Spot tra favole e inquietanti misteri

      06/08/2026
      Sol Cesto

      Sol Cesto: riaccendere il sole in un dungeon

      30/07/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      8a Scarpinata della Teverina

      A spasso per i sentieri: 8a Scarpinata della Teverina

      14/05/2024
      Valli e Calanchi

      A spasso per i sentieri: 1a Valli e Calanchi

      27/09/2023
      Maternum Marathon 2023

      A spasso per i sentieri: la 2a edizione di Maternum Marathon

      13/06/2023
      Il caffè riscrive il microbioma intestinale

      Il caffè riscrive il microbioma intestinale, e con esso umore, memoria e cognizione

      23/04/2026
      urano

      Le lune esterne di Urano Titania e Oberon, sono scure sul lato anteriore.

      19/06/2025
      Muon g-2

      L’anomalia Muon g-2 segue le leggi del Modello Standard

      13/06/2025
      Neuroplatform finalspark

      Neuroplatform, piattaforma online alimentata dal primo processore biologico al mondo

      27/05/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      la vita in scena

      La vita in scena, cosa resta del cinema di Vittorio De Sica

      16/06/2026

      Accordo Wizz Air e Starlink: Wi-Fi gratuito a bordo dal 2027

      09/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Home»Tech»Intelligenza artificiale»FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer
    Intelligenza artificiale

    FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

    FreeToken tratta il computer come un unico insieme elastico di risorse e ci fa girare modelli MoE che finora chiedevano hardware da datacenter
    GrazianoGraziano24/08/2026Updated:24/08/2026
    Share Twitter WhatsApp Bluesky Threads
    freetoken
    Freetoken

    Alcuni pesi di modelli di frontiera si scaricano gratuitamente, ma questo dice solo chi può ottenere un modello, non chi può permettersi di eseguirlo. I motori di inferenza disponibili oggi presuppongono ancora hardware da datacenter, e chi ha una GPU da gioco si ritrova a scegliere tra modelli piccoli o attese insostenibili.

    FreeToken parte esattamente da questa distanza. È un motore di inferenza pensato per i modelli Mixture-of-Experts, sviluppato da ricercatori di UC Berkeley insieme a colleghi di MIT e UT Austin, e pubblicato il 17 agosto 2026 con licenza Apache-2.0. Tra le firme del paper ci sono Ion Stoica e Matei Zaharia, cioè due nomi dietro Spark, Ray e buona parte dell’infrastruttura di calcolo distribuito degli ultimi quindici anni.

    L’idea di fondo è trattare un computer personale non come una GPU piccola, ma come un unico insieme elastico di risorse che comprende scheda video, processore, memoria di sistema e collegamento PCIe. Invece di decidere in anticipo cosa mettere dove, FreeToken misura le bande reali della macchina e ridistribuisce il lavoro a ogni passo.

    I numeri dichiarati sono notevoli. Un modello da 35 miliardi di parametri gira a 39,3 token al secondo su un portatile con RTX 4060 da 8 GB, mentre GLM-5.2 da 753 miliardi di parametri arriva a 14,9 token al secondo su una singola RTX PRO 6000. Nei confronti con llama.cpp, Ollama e KTransformers, il vantaggio dichiarato sul decode va da 1,5 a 2,3 volte.

    Perché i modelli MoE cambiano i conti della memoria

    In un modello Mixture-of-Experts ogni strato contiene decine o centinaia di sottoreti specializzate, chiamate esperti, e una piccola rete di instradamento sceglie quali attivare per ciascun token in ingresso. Il resto degli esperti resta fermo. I numeri di DeepSeek-V4-Flash rendono l’idea. Il modello ha 43 strati e in ognuno attiva 6 esperti su 256, quindi per ogni singolo token lavorano circa 13 miliardi di parametri su un totale di 284 miliardi. Dal punto di vista aritmetico, l’esecuzione locale diventa plausibile.

    Il problema è che la sparsità riduce il calcolo, non l’ingombro. Anche quantizzati a FP4, tutti gli esperti insieme occupano circa 140 GB, una cifra che nessuna scheda consumer avvicina. Gli esperti inattivi devono quindi vivere nella RAM di sistema ed entrare nel percorso di esecuzione solo su richiesta.

    Qui nasce il collo di bottiglia: ogni volta che il modello ha bisogno di un esperto che non si trova nella memoria della scheda video, le strade sono due. O quel blocco di pesi viene spedito dalla RAM alla scheda attraverso il bus PCIe, cioè il canale che collega la scheda video al resto del computer, oppure il calcolo viene svolto direttamente dal processore.

    Entrambe le strade sono lente per lo stesso motivo, ovvero la quantità di dati che riescono a spostare in un secondo. Questo valore si chiama banda, e sia il bus PCIe sia la memoria di sistema ne hanno molta meno di quella con cui una scheda video legge la memoria che ha a bordo. Il divario è netto. Una normale configurazione di RAM DDR5 a doppio canale sposta circa 80-90 gigabyte al secondo, mentre una RTX 4090 o una 5090 leggono dalla propria memoria tra 1 e 1,8 terabyte al secondo, cioè quindici o venti volte tanto. Servire un modello MoE in locale significa quindi gestire questo squilibrio. Il modo in cui lo si gestisce fa la differenza tra un sistema utilizzabile e uno che fa aspettare minuti prima di scrivere la prima parola.

    Le tre cose che gli altri motori sbagliano

    Il paper FreeToken di UC Berkeley è esplicito nell’elencare dove falliscono i motori esistenti, e vale la pena elencarli, perché spiegano tutto il resto del progetto.

    • La lettura iniziale del prompt annulla il risparmio. Prima di rispondere, il modello deve leggere tutto quello che gli hai scritto, la fase che in gergo si chiama prefill. Migliaia di token attraversano ogni strato insieme e, presi nel loro insieme, finiscono per richiamare quasi ogni esperto disponibile. Il vantaggio della sparsità sparisce e l’intero archivio attraversa il bus, con un costo di circa due secondi su una RTX 5090, cinque su un desktop con PCIe 4.0 e dieci o più sui collegamenti ridotti tipici dei portatili.
    • Il posizionamento fisso non segue il traffico. llama.cpp decide al caricamento quali pezzi tenere sulla scheda video, mentre KTransformers blocca in memoria un gruppo scelto in anticipo perché ritenuto il più richiesto. Siccome gli esperti chiamati cambiano a ogni token, gran parte del lavoro finisce comunque sul processore, mentre scheda video e bus restano fermi ad aspettare.
    • Il processore non regge il resto. Scaricare tutto sulla CPU sembra una soluzione elegante finché non si guardano le bande di memoria, che sono un ordine di grandezza sotto quelle della scheda video.

    La conseguenza pratica di questi tre difetti si vede nel tempo di attesa prima del primo token. Nei test riportati nel paper, il caso peggiore di FreeToken resta sotto i 44 secondi, mentre llama.cpp tocca 232 secondi, Ollama 179 e KTransformers arriva a 946. Vale la pena ricordare quanto conta il numero di 39,3 token al secondo citato per il portatile. Nei valori riportati dagli autori, la velocità di decode mediana misurata per Codex è di circa 33 token al secondo. Un portatile da mille euro, con un modello da 35 miliardi di parametri, si colloca quindi sopra quella soglia.

    Su questi benchmark serve la cautela di sempre, dato che i numeri arrivano dagli autori del sistema e sono misurati su macchine scelte da loro.

    Il meccanismo centrale, dividere le richieste tra bus e processore

    La trovata più elegante di FreeToken è quella che gli autori chiamano politica q star, e il ragionamento dietro è semplice. Sia i trasferimenti verso la scheda video sia i calcoli svolti dal processore attingono alla stessa RAM di sistema, quindi non sono due strade indipendenti, sono due modi di usare la stessa risorsa. L’immagine che aiuta è quella di una conduttura unica che alimenta due rubinetti. Aprendone uno solo non sfrutti tutta la portata disponibile, mentre aprendoli entrambi nella giusta proporzione sposti più acqua nello stesso tempo.

    Se il bus PCIe lavora al massimo, resta comunque della banda di memoria che i trasferimenti non stanno usando. FreeToken usa quel residuo. A ogni passo divide gli esperti mancanti in due gruppi, ne trasferisce una parte sulla scheda video e calcola il resto sul processore, poi somma i due risultati parziali. Il punto da sottolineare è che questa somma è esatta. Non c’è approssimazione, non c’è sostituzione di esperti, non viene toccato il router e non viene diminuita la precisione. L’output è identico a quello che produrrebbe lo stesso modello servito interamente su scheda video.

    Attorno a questo ci sono altri due meccanismi che contano parecchio nell’uso quotidiano.

    • Cache che sa dove tagliare. Mentre la scheda video calcola uno strato, il successivo viene già trasferito, così i due lavori si sovrappongono invece di alternarsi. In più il motore salva dei punti di ripristino nei momenti giusti della conversazione, ovvero all’inizio di un blocco di ragionamento o di una chiamata a uno strumento esterno. Sono esattamente i punti in cui un agente taglia e riscrive il testo, quindi una modifica costa solo il ricalcolo della parte nuova invece che dell’intera conversazione.
    • Memoria elastica. La cache degli esperti sulla scheda video può essere ridimensionata a motore acceso, senza riavvii e senza ricaricare i pesi. Un comando come ft ctl cache --moe 8k --kv 32k sposta lo spazio tra esperti e cache del contesto mentre il server continua a rispondere.

    FreeToken: installazione su Linux e applicazione desktop su Windows

    La riga di comando richiede Linux x86_64, una GPU NVIDIA con driver r580 o successivo su CUDA 13, e Python 3.10 o superiore. Non ci sono schede AMD, non c’è Apple Silicon, e i kernel CUDA vengono compilati alla prima esecuzione, quindi serve il toolkit con nvcc raggiungibile dal PATH.

    # Installazione da PyPI, con uv (consigliato)
    uv venv && source .venv/bin/activate
    uv pip install "freetoken[accel]"
    
    # Oppure dai sorgenti
    git clone https://github.com/FlashML-org/FreeToken.git && cd FreeToken
    uv venv && source .venv/bin/activate
    uv pip install -e ".[accel]"
    
    # Verifica
    ft --version
    

    Chi usa Windows non è tagliato fuori, ma passa da un’altra strada, cioè l’applicazione desktop scaricabile da flashml.ai, che installa il motore e aggiunge un’interfaccia grafica per scaricare modelli, chattare e regolare i parametri.

    Installazione del FreeToken Engine su Windows (circa 7GB)

    Avviare un server richiede un solo parametro, perché tutto il resto viene dedotto dal checkpoint e dalla scheda video installata.

    # Il modello può essere una cartella locale o un id di Hugging Face
    ft serve --model ~/models/Qwen3.6-35B-A3B
    
    # Una volta pronto, il log mostra:
    # API server is ready to serve on 127.0.0.1:1919
    
    # Chat da terminale, collegandosi al server già avviato
    ft shell
    
    # Stato, throughput, occupazione della memoria video
    ft ctl stats
    

    Un passaggio da fare una volta sola è la calibrazione delle bande, che scrive un profilo riutilizzato dal motore per scegliere la strategia di suddivisione. Senza quel profilo il sistema resta su una modalità più conservativa.

    # Misura banda di memoria e banda PCIe con i kernel reali
    ft bench bw
    
    # Solo i formati in uso
    ft bench bw --dtype nvfp4,bf16
    

    I modelli supportati coprono buona parte di quello che è uscito nell’ultimo anno, tra cui DeepSeek-V4-Flash, GLM-5.2 e GLM-4.7 nelle versioni NVFP4, la famiglia Qwen3.6 e Qwen3.5, gpt-oss nelle taglie da 20 e 120 miliardi, Gemma-4, MiniMax-M2.5. I checkpoint vengono letti direttamente in formato safetensors, con la possibilità di preconvertirli in un formato interno a caricamento rapido.

    Collegare Claude Code, Codex e gli altri agenti al proprio computer

    La funzione che rende FreeToken interessante oltre la curiosità tecnica è la compatibilità con le due API di cui ormai tutti gli strumenti fanno uso. Il server espone gli endpoint in stile OpenAI, ovvero /v1/chat/completions, /v1/responses e /v1/models, e quelli in stile Anthropic, cioè /v1/messages e /v1/messages/count_tokens.

    Qualunque libreria client scritta per una delle due funziona cambiando il solo indirizzo di base. Un test rapido si fa con un comando curl, senza installare nulla.

    curl http://127.0.0.1:1919/v1/chat/completions \
      -H 'Content-Type: application/json' \
      -d '{
        "model": "Qwen3.6-35B-A3B",
        "messages": [{"role": "user", "content": "Spiega cosa fa questa funzione"}],
        "max_tokens": 256,
        "stream": true
      }'
    

    Per gli agenti di coding esiste una scorciatoia, il comando ft launch scrive la configurazione del provider per l’agente scelto, ne installa la riga di comando se manca e lo avvia puntandolo al tuo server.

    Gli agenti riconosciuti sono sei e coprono i nomi più diffusi del momento.

    • Claude Code. L’agente da terminale di Anthropic, oggi il più usato tra chi lavora a riga di comando, si collega con ft launch claude.
    • Codex CLI. La controparte di OpenAI, che con ft launch codex interroga il tuo server invece dei server dell’azienda.
    • OpenCode. Alternativa open source molto seguita, nata proprio per non dipendere da un singolo fornitore di modelli.
    • OpenClaw e Hermes. Due progetti aperti, pensati fin dall’inizio per funzionare anche con modelli locali.
    • dsh. È il DeepSeek Harness, l’ambiente ufficiale con cui DeepSeek fa girare i propri modelli in modalità agente.

    La combinazione più immediata è quella tra Claude Code e un modello da 35 miliardi di parametri quantizzato, perché resta nei limiti di memoria di una scheda da gioco e mantiene una velocità di scrittura comoda da seguire a schermo.

    # Agenti supportati: claude, codex, dsh, hermes, openclaw, opencode
    ft launch claude
    
    # Mostra le modifiche previste senza toccare nulla
    ft launch codex --dry-run

    Le chiavi API dei servizi cloud, da ANTHROPIC_API_KEY a OPENAI_API_KEY, vengono cancellate dall’ambiente del processo figlio, così l’agente non può ripiegare in silenzio su un endpoint a pagamento se il server locale si inceppa.

    FreeToken: numeri dichiarati e requisiti

    Il primo limite è quello hardware. La riga di comando gira solo su Linux con schede NVIDIA recenti, mentre l’applicazione desktop copre solo Windows. Chi lavora su Mac, su schede AMD o su Intel Arc resta fuori, e per quel pubblico llama.cpp rimane l’unica strada praticabile.

    Il secondo limite riguarda lo spazio su disco e la memoria di sistema. Far girare un modello da 284 o 753 miliardi di parametri significa tenere quei pesi sul disco e caricarne una buona parte nella RAM del computer.

    Il paper parla di circa 140 GB per l’insieme degli esperti di DeepSeek-V4-Flash in formato FP4. La scheda video da 8 GB è quindi solo una parte del racconto, e il resto lo fanno un SSD capiente e una dotazione di memoria generosa.

    Anche la quantità di impostazioni disponibili è notevole, con decine di parametri che governano il modo di calcolare l’attenzione, la dimensione delle pagine della cache e la suddivisione degli strati. Nulla di tutto questo è un difetto, ma non è materiale per chi cerca un’installazione da tre clic.

    Una scommessa che ripaga chi ha già una buona GPU da gioco

    FreeToken non è il primo tentativo di far girare modelli grandi su hardware piccolo (ricordiamo anche Colibrì), ma è il primo che affronta il problema come una questione di bande misurate.

    Il valore dipende da cosa possiedi già. Chi ha una scheda da gioco recente e paga un abbonamento mensile per un agente di coding ha ora un motivo per fare due conti, perché una configurazione locale che regge 35 miliardi di parametri cambia i calcoli della spesa. Chi tratta dati che non possono uscire dall’azienda ha un motivo ancora più forte, dato che non esce nulla dalla macchina.

    Il consiglio pratico è partire in basso e salire. Installa il pacchetto, esegui la calibrazione delle bande, prova un modello da 30 o 35 miliardi quantizzato e collegaci il tuo agente con ft launch. Solo dopo, se la macchina regge, ha senso puntare ai modelli ancora più prestanti.

    Nonostante qualche limite, il codice è Apache-2.0, la firma è quella del laboratorio che ha prodotto Spark e Ray, e la direzione indicata è quella giusta, cioè trasformare i pesi aperti in software che gira davvero sulle macchine che la gente possiede già.

    #LocalAI AI freetoken LLM moe opensource
    Previous ArticleVercel fx, un agente di coding da 6 MB in Zig
    Avatar photo
    Graziano
    • Website

    Ho visto l'informatica nascere con il C64 e oggi seguo con lo stesso entusiasmo l'evoluzione verso mini PC e desktop SFF. Fuori dal lavoro, le mie passioni sono i film, il trekking, la bici e la corsa. Ma non disdegno una sessione di gaming o programmazione!

    Articoli collegati

    Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.
    Intelligenza artificiale

    Vercel fx, un agente di coding da 6 MB in Zig

    24/08/2026
    Ox Alpha
    Intelligenza artificiale

    Ox Alpha, il modello anonimo che tutti stanno provando gratis

    22/08/202637 Views
    scrcpy
    Software

    scrcpy: controllare Android dal PC senza root e senza spendere

    22/08/202626 Views
    Add A Comment
    Leave A Reply Cancel Reply

    Ultimi articoli
    Illustrazione in stile incisione tecnica: un piccolo strumento di misura di precisione appoggiato su un righello graduato, accanto a un ingranaggio industriale che esce dai bordi dell'inquadratura. In alto a sinistra il logo di fx di Vercel Labs.

    Vercel fx, un agente di coding da 6 MB in Zig

    24/08/2026
    ASRock B850M Challenger WiFi

    ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

    24/08/2026
    Ox Alpha

    Ox Alpha, il modello anonimo che tutti stanno provando gratis

    22/08/202637 Views
    scrcpy

    scrcpy: controllare Android dal PC senza root e senza spendere

    22/08/202626 Views
    Proton Mail marketing graphic showing a mobile inbox with Primary, Promotions, Updates tabs on a purple gradient background and 'Mail update' label on the left panel.

    Proton Mail introduce le categorie automatiche per organizzare la posta in arrivo

    21/08/202618 Views
    Black-and-white rust-streaked background with a circular gear housing a bold 'R' logo and the text 'RUST 1.98' beneath.

    Rust 1.98 è disponibile: tutte le novità sui calcoli in virgola mobile

    21/08/2026
    Gomoot : tecnologia e lifestyle
    X (Twitter) Bluesky WhatsApp Threads Mastodon
    • Home
    • Tech
    • Mobiles
    • Contatti
    • Privacy
    • ABOUT
    © 2026 GOMOOT.COM

    Type above and press Enter to search. Press Esc to cancel.