Close Menu
Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Ultimi Articoli
    Omarchy 4

    Omarchy 4, la distro Linux che si installa in pochi minuti e funziona già come vuoi tu

    29/08/2026
    Audeze Maxwell 2

    Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

    29/08/2026
    MS-03 screenshot 1

    Minisforum MS-03: Panther Lake e doppia fibra 10G in meno di due litri

    29/08/2026
    TH87 ISO featured

    Epomaker TH87 ISO, tocco morbido e batteria da 10.000 mAh

    29/08/2026
    Ubuntu 26.04.1 LTS

    Ubuntu 26.04.1 LTS, il point release frenato da rust-coreutils

    28/08/202638 Views
    decine di carretti carichi di casse percorrono strade diverse che confluiscono tutte su un unico ponte di pietra, dove un uomo seduto in un casello rosso con la sbarra alzata annota il passaggio su un registro.

    Nvidia compra Hugging Face per 12,9 miliardi, e non lo fa per i 150 milioni di ricavi annuali

    27/08/202625 Views
    Breathedge

    Breathedge, come sopravvivere nello spazio con una gallina e molto sarcasmo

    27/08/202616 Views
    Huawei Band 11

    Huawei Band 11: la smartband che punta tutto sulla qualità del monitoraggio

    27/08/2026
    domenica 30 Agosto 2026
    X (Twitter) Threads Mastodon Bluesky WhatsApp
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    • Home
    • Computer
      1. MINI PC
      2. Laptop
      3. Monitor
      4. Teoria
      5. Mouse
      6. GPU
      7. Windows
      8. Motherboard
      9. Tastiere
      10. View All
      MS-03 screenshot 1

      Minisforum MS-03: Panther Lake e doppia fibra 10G in meno di due litri

      29/08/2026
      NiPoGi E3B

      Mini PC NiPoGi E3B con Ryzen 7 5700U: potenza compatta ad un prezzo aggressivo

      26/03/2026

      GEEKOM A5: mini pc con buone prestazioni grazie all’AMD Ryzen 7 5800H

      26/03/2026
      Geekom A8

      Recensione Geekom A8: il mini PC AMD che non ti aspetti

      11/03/2026
      Slim silver ASUS Vivobook laptop open on a pastel yellow/blue abstract background.

      ASUS Vivobook Go 15, il notebook essenziale

      07/08/2026
      MacBook Neo

      MacBook Neo, il portatile entry-level di Apple

      30/03/2026
      Galaxy Book5 Pro

      Il Samsung Galaxy Book5 Pro sfida il MacBook su qualità e autonomia

      18/03/2026
      Lenovo Chromebook Duet 11

      Lenovo Chromebook Duet 11, un versatile 2-in-1 con 10 anni di aggiornamenti

      24/12/2025
      G-Master GOB2701QSC-B1

      iiyama G-Master GOB2701QSC-B1 Titan Falcon: il tandem WOLED che porta l’OLED sotto i 500 euro

      26/08/2026
      TCL27C2A

      TCL 27C2A: 1.196 zone di local dimming, il QD-Mini LED che cambia le regole del 4K

      13/07/2026
      Asus VA279QG

      ASUS VA279QG, monitor 27″ per lavoro, svago e gaming

      20/06/2026

      ASUS ROG Strix XG27AQNGV, il monitor per i competitive gamer

      05/05/2026
      Immich 3.0

      Immich 3.0, cosa cambia per chi gestisce la propria libreria fotografica

      03/07/2026
      Immich

      Immich: accelerazione GPU, ricerca CLIP multilingua e External Library

      09/05/2026
      uv astral

      Il tooling Python è sempre stato un disastro. uv risolve tutto in un colpo solo

      04/05/2026

      Mise-en-place sta cambiando il modo di gestire gli ambienti di sviluppo

      01/05/2026
      Acer wireless mouse with USB dongle on a festive gradient blue background with a gold balloon and colorful confetti pieces nearby.

      Acer, il mouse wireless ergonomico per l’uso quotidiano

      19/08/2026

      Logitech Mobi Fold è il mouse pieghevole per chi viaggia

      11/06/2026

      Logitech G Pro X2 Superstrike, il mouse con tecnologia HITS per click più veloci

      10/02/2026
      Mouse NZXT Lift 2

      Mouse NZXT Lift 2, mouse filare ultraleggero e preciso

      21/12/2025
      rtx spark

      Con RTX Spark, NVIDIA reinventa il PC Windows

      08/06/2026
      MatX

      MatX raccoglie 500 milioni di dollari per sfidare Nvidia

      25/02/2026
      nvidia rtx 5090 ti

      Nvidia prepara una RTX 5090 “estrema” per il 2026

      09/02/2026
      dlss45 MFG 6× nvidia

      NVIDIA dynamic MFG e MFG 6×: più intelligenza per i frame generati

      06/02/2026
      OptimizerDuck

      Ottimizzare Windows senza rischi con optimizerDuck

      04/08/2026
      Colorful floating Office app icons (Word, Excel, PowerPoint, Outlook) on a light blue background.

      Windows 10 ancora protetto e gratis fino a ottobre 2027

      26/06/2026
      winget configuration

      WinGet Configuration configura Windows da zero con un solo comando

      02/06/2026
      Windhawk

      Windhawk: il marketplace di mod che modella Windows 11 a tuo piacere

      28/05/2026
      ASRock B850M Challenger WiFi

      ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

      24/08/2026

      Arduino UNO Q raddoppia RAM e storage

      23/01/2026
      ROG Strix B860-A Gaming

      Asus ROG Strix B860-A Gaming WiFi, motherboard per build ad alte prestazioni.

      17/01/2026
      pcie 250watt

      Asus alimenta una RTX 5060 Ti da 250 W su uno slot PCIe potenziato

      23/09/2025
      TH87 ISO featured

      Epomaker TH87 ISO, tocco morbido e batteria da 10.000 mAh

      29/08/2026
      Epomaker G84 HE

      Recensione tastiera gaming Epomaker G84 HE

      18/08/2026
      Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

      Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

      27/07/2026
      Epomaker HE75 V2

      Epomaker HE75 V2, il magnetico smette di essere una promessa

      20/06/2026
      Omarchy 4

      Omarchy 4, la distro Linux che si installa in pochi minuti e funziona già come vuoi tu

      29/08/2026
      MS-03 screenshot 1

      Minisforum MS-03: Panther Lake e doppia fibra 10G in meno di due litri

      29/08/2026
      TH87 ISO featured

      Epomaker TH87 ISO, tocco morbido e batteria da 10.000 mAh

      29/08/2026
      Ubuntu 26.04.1 LTS

      Ubuntu 26.04.1 LTS, il point release frenato da rust-coreutils

      28/08/2026
    • Tech
      1. Curiosità
      2. Eventi
      3. memory cards
      4. Powerbank
      5. Smartwatch
      6. Gadgets
      7. Bluetooth speakers
      8. Intelligenza artificiale
      9. Offerte
      10. Software
      11. View All

      Starlink abbassa i satelliti per sicurezza orbitale

      02/01/2026

      Con Nano Banana, Gemini supera ChatGPT tra le app AI

      17/09/2025
      grotta lunare

      Scoperta una grotta lunare sotterranea

      16/07/2024
      Oleg Kononenko

      Oleg Kononenko: 1000 giorni nello spazio

      05/06/2024

      Dataland, il primo museo di arte AI al mondo apre a LA

      19/06/2026
      Google I/O 2026

      La conferenza Google I/O 2026 sarà a maggio

      18/02/2026

      NASA rinvia Artemis II per perdite di idrogeno

      03/02/2026
      BYD YangWang U9 Extreme

      BYD YangWang U9 Extreme: il nuovo re della velocità tra le auto di serie

      24/09/2025
      SSD Crucial P310 2TB

      Crucial P310 2TB SSD NVMe: storage ad alta velocità a un ottimo prezzo

      08/06/2025
      V-NAND QLC Samsung

      Il futuro dello storage è pronto: Samsung svela la V-NAND QLC da 1 Tb

      12/09/2024
      microSD SD Express

      Samsung presenta la prima microSD SD Express

      07/03/2024

      ADATA lancia il primo SSD esterno USB4 SE920

      31/10/2023
      Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

      Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

      24/07/2026
      power bank

      Power Bank cablati e wireless Qi2 : guida all’acquisto

      03/03/2026

      Anker Nano Power Bank 5K, il caricatore più sottile con MagSafe e Qi2

      22/01/2026
      Sharge ICEMAG 2

      Sharge ICEMAG 2: power bank Qi2 15W con raffreddamento attivo

      12/05/2025
      Black smartwatch with circular dial hovering above a metallic display plinth in a studio setting, showcasing its features.

      Honor Watch 6, lo smartwatch che dura settimane

      03/08/2026
      Smartwatch close-up showing a globe dial with white 09 and orange 30 on a black background with orange accents.

      OPPO Watch X3, lo smartwatch Android resistente e autonomo

      16/07/2026
      Xiaomi Watch S5

      Xiaomi Watch S5, il nuovo smartwatch in acciaio e con autonomia record

      19/06/2026

      Xiaomi Redmi Watch 6, a meno di 100 euro fa cose che non ti aspetti

      12/06/2026
      Futuristic game controller with glowing RGB ring lights, floating in an abstract, swirling background.

      EasySMX X15, il controller economico a effetto Hall

      11/08/2026
      Hue Bridge Pro

      Philips Hue Bridge Pro: novità e prestazioni del nuovo hub smart

      03/07/2026

      Blink Outdoor 4 è in offerta adesso, sorveglianza esterna senza abbonamento cloud

      22/06/2026

      WiiM Sound Lite: speaker Wi-Fi perfetto per l’audio domestico

      11/05/2026

      JBL Xtreme 3, altoparlante potente e impermeabile

      19/05/2026

      JBL Boombox 4: speaker Bluetooth con AI e USB-C lossless

      18/05/2026
      JBL Clip 5

      JBL Clip 5, lo speaker Bluetooth ultra-portatile e suono potente

      16/05/2026
      Marshall Emberton III

      Marshall Emberton III: il re portatile del suono rock

      15/05/2026
      decine di carretti carichi di casse percorrono strade diverse che confluiscono tutte su un unico ponte di pietra, dove un uomo seduto in un casello rosso con la sbarra alzata annota il passaggio su un registro.

      Nvidia compra Hugging Face per 12,9 miliardi, e non lo fa per i 150 milioni di ricavi annuali

      27/08/2026
      Qwen3.8-Flash-Next

      Qwen3.8-Flash-Next è l’assaggio di Qwen4, ed è già su Hugging Face.

      27/08/2026
      GLM-5.3-Flash

      GLM-5.3-Flash, Z.ai toglie la maschera a Ox Alpha

      27/08/2026
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026
      Ultimate Ear Wonderboom 3

      Ultimate Ears WONDERBOOM 3: suono di qualità a un prezzo accessibile

      24/03/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      nubia z60 ultra

      Offerte Black Friday Nubia: telefoni premium a prezzi convenienti

      22/11/2024
      Scream Fest 2024

      Steam Scream Fest 2024: sconti horror per Halloween

      29/10/2024
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026
      scrcpy

      scrcpy: controllare Android dal PC senza root e senza spendere

      22/08/2026
      portmaster

      Chi contatta chi sul tuo computer? Portmaster te lo mostra e se vuoi te lo blocca

      10/08/2026
      Kanata

      Kanata dà i layer di QMK a qualsiasi tastiera, anche a quella del portatile

      08/08/2026
      decine di carretti carichi di casse percorrono strade diverse che confluiscono tutte su un unico ponte di pietra, dove un uomo seduto in un casello rosso con la sbarra alzata annota il passaggio su un registro.

      Nvidia compra Hugging Face per 12,9 miliardi, e non lo fa per i 150 milioni di ricavi annuali

      27/08/2026
      Huawei Band 11

      Huawei Band 11: la smartband che punta tutto sulla qualità del monitoraggio

      27/08/2026
      Qwen3.8-Flash-Next

      Qwen3.8-Flash-Next è l’assaggio di Qwen4, ed è già su Hugging Face.

      27/08/2026
      GLM-5.3-Flash

      GLM-5.3-Flash, Z.ai toglie la maschera a Ox Alpha

      27/08/2026
    • Mobiles
      1. Smartphones
      2. View All
      Lavender smartphone with a triple-camera back and a stylus hovering beside it on a soft abstract background.

      Galaxy A37, il medio di gamma Samsung che convince

      06/07/2026
      Honor 400 Pro

      Honor 400 Pro: hardware da top di gamma con aggiornamenti fino al 2031

      03/07/2026
      Motorola Razr 70

      Motorola Razr 70, il pieghevole compatto ed elegante

      01/07/2026

      RedMagic 11S Pro, tanta potenza e autonomia per il re degli smartphone da gioco

      23/06/2026
      Tablet angled against a pastel wavy background, screen showing bright overlapping colorful circles in blue, pink, yellow.

      iPad 11, il tablet più accessibile di Apple

      08/08/2026
      Tablet with black frame displaying colorful abstract wallpaper, shown front and back against an orange–purple gradient background.

      TCL Tab A1 Plus, il tablet economico per streaming, lettura e produttività leggera

      04/08/2026
      Google Apple

      Google Health 5.05 porta la sincronizzazione bidirezionale con Apple Salute

      04/08/2026
      Oppo 5 Pad

      OPPO Pad 5, un tablet Android pensato per studio, lavoro e intrattenimento quotidiano

      29/07/2026
    • Musica
      1. Cuffie
      2. DAC
      3. hi-fi
      4. Teoria
      5. View All
      Audeze Maxwell 2

      Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

      29/08/2026
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Truthear KeyX

      Truthear KeyX, un DAC dongle che vale ogni centesimo

      28/04/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      FiiO BTR15

      FiiO BTR15: DAC Bluetooth al prezzo più basso di sempre

      17/05/2025

      Edifier R1280DBs, ottimi diffusori da scaffale economici

      20/06/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      Focal Aria 926

      Componenti per un ottimo impianto stereo

      31/07/2024
      truffa phishing zalando

      Truffa phishing: in regalo la gift card Zalando da 150€

      06/12/2024
      sim ed esim

      Differenza tra SIM fisica ed eSIM: vantaggi e sicurezza

      02/11/2024

      Malware: cosa sono e come difendersi

      19/10/2024
      crittografia a cosa serve

      Crittografia, come funziona e perchè dobbiamo utilizzarla

      16/10/2024
      Audeze Maxwell 2

      Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

      29/08/2026
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
    • Lifestyle
      1. Criptovalute
      2. EV
      3. Gaming
      4. Trekking
      5. Scienze
      6. View All
      Alpha Arena : trading ai bot

      Alpha Arena : sfida tra modelli AI nel trading di criptovalute

      20/10/2025
      Coinbase

      Coinbase colpita da attacco informatico e minaccia di riscatto

      15/05/2025
      coinbase

      Coinbase : acquisti cripto tramite Apple Pay

      03/12/2024
      criptovalute

      Criptovalute: cosa sono e come funzionano le monete virtuali

      19/10/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
      tesla

      Tesla dice addio a Model S e Model X ma accelera sugli EV autonomi e i robot umanoidi

      29/01/2026
      Volvo EX60

      Volvo EX60: la sfida scandinava al dominio tedesco degli elettrici premium

      22/01/2026
      Breathedge

      Breathedge, come sopravvivere nello spazio con una gallina e molto sarcasmo

      27/08/2026
      Cardpocalypse

      Cardpocalypse, duelli tra carte e nostalgia in salsa cartone animato

      20/08/2026
      Caravan SandWitch

      Caravan SandWitch, l’avventura senza combattimenti di Studio Plane Toast

      13/08/2026
      Beacon Pines

      Beacon Pines, il romanzo interattivo di Hiding Spot tra favole e inquietanti misteri

      06/08/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      8a Scarpinata della Teverina

      A spasso per i sentieri: 8a Scarpinata della Teverina

      14/05/2024
      Valli e Calanchi

      A spasso per i sentieri: 1a Valli e Calanchi

      27/09/2023
      Maternum Marathon 2023

      A spasso per i sentieri: la 2a edizione di Maternum Marathon

      13/06/2023
      Il caffè riscrive il microbioma intestinale

      Il caffè riscrive il microbioma intestinale, e con esso umore, memoria e cognizione

      23/04/2026
      urano

      Le lune esterne di Urano Titania e Oberon, sono scure sul lato anteriore.

      19/06/2025
      Muon g-2

      L’anomalia Muon g-2 segue le leggi del Modello Standard

      13/06/2025
      Neuroplatform finalspark

      Neuroplatform, piattaforma online alimentata dal primo processore biologico al mondo

      27/05/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      la vita in scena

      La vita in scena, cosa resta del cinema di Vittorio De Sica

      16/06/2026

      Accordo Wizz Air e Starlink: Wi-Fi gratuito a bordo dal 2027

      09/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Home»Tech»Intelligenza artificiale»Colibrì, il motore in puro C che fa girare GLM-5.2 sul PC di casa
    Intelligenza artificiale

    Colibrì, il motore in puro C che fa girare GLM-5.2 sul PC di casa

    Colibrì fa girare GLM-5.2, un modello AI da 744 miliardi di parametri, su un PC con 25 GB di RAM e un SSD veloce, ecco come funziona lo streaming degli esperti e cosa aspettarsi.
    GrazianoGraziano16/07/2026Updated:16/07/202681
    Share Twitter WhatsApp Bluesky Threads
    Colibrì
    Colibrì gestisce al meglio gli esperti MoE di GLM-5.2

    Nel mondo dell’intelligenza artificiale locale c’è una regola non scritta, ovvero che i modelli davvero grandi restano fuori dalla portata dei comuni mortali. Per far girare un modello di classe frontier servono decine di GPU professionali, il cui prezzo si misura in centinaia di migliaia di euro. Colibrì, un progetto open source pubblicato su GitHub dallo sviluppatore italiano JustVugg (alias Vincenzo) , prova a ribaltare questa regola.

    Il suo motore, scritto interamente in linguaggio C e senza alcuna dipendenza esterna, riesce a eseguire GLM-5.2, un modello da 744 miliardi di parametri, su una macchina con circa 25 GB di RAM e un buon SSD. Non è un trucco che degrada il modello, né una versione ridotta, perché il modello resta quello originale, quantizzato in int4, e risponde in locale, senza cloud e senza abbonamenti.

    Il prezzo da pagare è la velocità, e su questo il progetto è trasparente, tanto che una sezione del README si intitola proprio “Honest numbers”. In questa guida vedremo come funziona il meccanismo di streaming degli esperti che rende possibile tutto questo, cosa serve per provarlo, quali numeri aspettarsi e perché, anche con i suoi limiti, è uno dei progetti più interessanti del panorama AI in locale di quest’anno.

    Mixture of Experts

    Per capire il trucco di Colibrì bisogna prima capire com’è fatto GLM-5.2. I modelli moderni di grandi dimensioni usano quasi tutti un’architettura chiamata Mixture of Experts (MoE), che si può immaginare come un enorme ufficio pieno di specialisti. Invece di un unico cervello monolitico che si attiva per intero a ogni parola, il modello è diviso in diversi piccoli “esperti”, e un componente chiamato router decide di volta in volta quali interpellare.

    Nel caso di GLM-5.2 gli esperti sono 19.456, distribuiti su 75 livelli, ma per generare ogni singolo token ne viene attivata solo una piccola frazione. Dei 744 miliardi di parametri totali, quelli effettivamente al lavoro in un dato momento sono circa 40 miliardi. C’è di più, perché tra un token e il successivo la parte che cambia davvero è ancora più piccola, ovvero circa 11 GB di dati relativi agli esperti selezionati dal router.

    Qui sta l’intuizione. Se in ogni istante serve solo una fetta sottile del modello, non è necessario tenere tutto in memoria contemporaneamente. È la stessa logica per cui una biblioteca non fotocopia l’intero catalogo sulla tua scrivania, ma ti porta i volumi che chiedi, uno alla volta.

    I motori tradizionali per l’AI locale, tuttavia, non ragionano così, perché vogliono l’intero modello in RAM o in VRAM prima di partire. Per un colosso come GLM-5.2, che occupa circa 370 GB già compresso in int4, questo significa semplicemente non partire mai su hardware consumer. Colibrì nasce esattamente per rompere questo vincolo.

    L’idea alla base, tenere gli esperti sul disco

    La soluzione di Colibrì è trattare VRAM, RAM e disco come un’unica gerarchia di memoria, gestita dal motore. La parte “densa” del modello, cioè quella che serve sempre (attenzione, embeddings e alcuni esperti condivisi), viene caricata in RAM una volta sola e occupa appena 9,9 GB in int4. Tutti gli altri esperti, ovvero il grosso di quei 370 GB, restano sul disco e vengono letti su richiesta, nel momento esatto in cui il router li chiama.

    colibri

    Per non morire di lentezza, il motore usa una serie di accorgimenti. Gli esperti usati di recente restano in una cache LRU in RAM, dimensionata automaticamente in base alla memoria disponibile, così le richieste su argomenti simili riusano ciò che è già stato caricato. Inoltre, mentre un blocco di esperti viene elaborato, il motore sta già leggendo il successivo in modo asincrono, e la cache del sistema operativo fa da secondo livello gratuito.

    A tutto questo si aggiunge la decodifica speculativa MTP, una tecnica in cui una testa dedicata del modello “abbozza” più token in anticipo e il modello principale li verifica in un colpo solo, con un guadagno misurato di 2,2-2,8 token per passaggio. Chi ha una scheda NVIDIA può anche attivare un livello CUDA opzionale per tenere gli esperti più usati in VRAM.

    La parte che colpisce di più è l’implementazione. Il motore è un singolo file C più qualche header, senza BLAS, senza framework e senza Python a runtime (serve solo per la conversione iniziale del modello). Il paragone con progetti come llama.cpp, che pure resta molto più veloce sui modelli che entrano in memoria, viene naturale, ma la filosofia è diversa, perché qui l’intento dichiarato è non toccare mai la precisione del modello o le decisioni del router. Se la memoria veloce non basta, cala la velocità, non la qualità.

    Cosa serve e come si installa

    I requisiti sono meno estremi di quanto ci si aspetterebbe. Servono circa 25 GB di RAM, un SSD NVMe con 400 GB liberi e un sistema Linux, WSL2 oppure Windows 11 nativo, dove il progetto compila con MinGW-w64. La velocità del disco è il vero collo di bottiglia, quindi più l’unità è rapida, meglio è.

    La compilazione richiede pochi comandi:

    git clone https://github.com/JustVugg/colibri
    cd colibri/c
    ./setup.sh    # verifica gcc/OpenMP, compila e lancia i test
    

    Per il modello ci sono due strade. La prima è la conversione automatica, dove un solo comando scarica GLM-5.2 uno shard alla volta (circa 5 GB ciascuno), lo converte in int4 e cancella man mano gli originali, senza mai richiedere i 756 GB del checkpoint completo su disco. Il processo è riprendibile se si interrompe:

    pip install torch safetensors huggingface_hub numpy
    ./coli convert --model /nvme/glm52_i4
    

    La seconda strada, più comoda, è scaricare da Hugging Face il modello già convertito (repository mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp). Attenzione a un dettaglio importante, segnalato dallo stesso progetto, cioè che la testa MTP deve essere in int8. Un vecchio mirror la distribuiva in int4 e in quel caso la decodifica speculativa non si attiva mai, facendo perdere circa metà della velocità.

    A quel punto si parte con un comando solo:

    COLI_MODEL=/nvme/glm52_i4 ./coli chat
    

    Prima di caricare tutto, vale la pena usare due strumenti inclusi. Il comando coli plan mostra in anticipo come verranno distribuiti i pesi tra disco, RAM ed eventuale VRAM, mentre coli doctor esegue un controllo di compatibilità completo, dal modello alla memoria disponibile, senza avviare nulla.

    I numeri, dichiarati onestamente

    Il README dedica una sezione intera ai numeri reali, misurati su una macchina di sviluppo modesta, con 12 core, 25 GB di RAM e un NVMe. Riassumiamo i valori principali in tabella.

    MetricaValore misurato
    Modello su disco (int4)~370 GB
    RAM residente9,9 GB
    Tempo di caricamento~30 secondi
    Picco RAM in chat~20 GB (auto-limitato)
    Letture disco a cache fredda~11 GB per token
    Velocità a cache fredda0,05-0,1 token/s
    Speculazione MTP (testa int8)2,2-2,8 token per passaggio

    Il progetto non gira intorno alla questione, e lo scrive nero su bianco, ovvero che non è veloce. A cache fredda si parla di un token ogni dieci-venti secondi, un ritmo da telegrafo. Con la cache calda, gli esperti “caldi” fissati in RAM e la speculazione MTP attiva, la latenza delle risposte utili scende parecchio, ma resta un’esperienza che richiede pazienza, adatta a domande secche più che a lunghe conversazioni.

    Il quadro però cambia con hardware migliore. In un esperimento documentato nel repository, su una macchina con 6 RTX 5090 e l’intero set di esperti distribuito tra VRAM e RAM, il motore raggiunge 6,84 token al secondo in decodifica singola. Non sono numeri da datacenter, ma per un modello di questa stazza su hardware da appassionati è un risultato notevole.

    Una nota rassicurante riguarda l’SSD. Lo streaming di Colibrì è in sola lettura, e le letture non consumano le celle di memoria come fanno le scritture. I veri punti di attenzione sono lo swap, da evitare con un budget RAM sensato (il motore lo calcola da solo), e le temperature dell’unità durante sessioni lunghe, che conviene tenere d’occhio sui drive più economici.

    La dashboard web e il cervello in diretta

    Oltre alla chat da terminale, il comando ./coli web avvia una dashboard nel browser che è uno dei tratti più riusciti del progetto. La schermata principale mostra le metriche in tempo reale, tra cui token al secondo, occupazione di RAM e VRAM e la distribuzione degli esperti tra i tre livelli di memoria, con un pannello hardware che fotografa lo stato della macchina.

    La pagina più affascinante si chiama Brain: visualizza tutti i 19.456 esperti del modello come una specie di corteccia viva, dove il colore indica il livello di memoria in cui risiede ciascun esperto (VRAM, RAM o disco) e la luminosità riflette quanto viene interpellato dal router. Ogni volta che un esperto partecipa a una risposta, il suo puntino lampeggia in bianco.

    L’effetto è anche didattico, perché guardando la pagina Brain mentre il modello risponde si vede letteralmente quali zone del “cervello” si accendono a seconda dell’argomento. Passando il mouse su un esperto compare persino la sua affinità tematica misurata, frutto di un’analisi documentata in una delle issue del progetto. Per chi ha sempre trovato i modelli linguistici delle scatole nere, è un modo insolitamente chiaro di vederli lavorare.

    Non manca la persistenza delle conversazioni, gestita in modo intelligente. Il motore salva su disco la memoria interna della chat (la cosiddetta KV-cache) dopo ogni scambio, così alla riapertura la conversazione riparte già calda, senza dover rielaborare tutto lo storico.

    Un laboratorio affascinante per smanettoni

    Colibrì per ora non sostituirà i servizi cloud. A cache fredda è lento in modo quasi disarmante, richiede 400 GB di spazio su un NVMe veloce e dà il meglio solo dopo qualche scambio, quando cache e speculazione entrano a regime. Chi cerca un assistente reattivo per il lavoro di tutti i giorni farà meglio a guardare altrove, magari verso modelli più piccoli che stanno comodamente in RAM.

    Il valore del progetto sta altrove. Primo, dimostra nei fatti che la barriera tra hardware consumer e modelli frontier è meno solida di quanto sembri, perché la fisica del disco impone lentezza, non impossibilità. Come recita il README con una punta di orgoglio, è un modello da 744 miliardi di parametri che risponde correttamente su una macchina che costa meno di una singola ventola di un acceleratore da datacenter.

    Secondo, è software scritto con una cura d’altri tempi, in puro C, con zero dipendenze, test di fedeltà contro l’implementazione di riferimento e una documentazione che dichiara i limiti con la stessa precisione dei pregi. Se hai un SSD capiente, una domenica libera e la curiosità di vedere un gigante camminare nel tuo studio, Colibrì merita il download. Anche solo per guardare la pagina Brain accendersi.

    colibri glm52 justvugg moe
    Previous ArticleLuto, la casa come prigione del dolore
    Next Article OPPO Watch X3, lo smartwatch Android resistente e autonomo
    Avatar photo
    Graziano
    • Website

    Ho visto l'informatica nascere con il C64 e oggi seguo con lo stesso entusiasmo l'evoluzione verso mini PC e desktop SFF. Fuori dal lavoro, le mie passioni sono i film, il trekking, la bici e la corsa. Ma non disdegno una sessione di gaming o programmazione!

    Articoli collegati

    decine di carretti carichi di casse percorrono strade diverse che confluiscono tutte su un unico ponte di pietra, dove un uomo seduto in un casello rosso con la sbarra alzata annota il passaggio su un registro.
    Intelligenza artificiale

    Nvidia compra Hugging Face per 12,9 miliardi, e non lo fa per i 150 milioni di ricavi annuali

    27/08/202625 Views
    Qwen3.8-Flash-Next
    Intelligenza artificiale

    Qwen3.8-Flash-Next è l’assaggio di Qwen4, ed è già su Hugging Face.

    27/08/202625 Views
    GLM-5.3-Flash
    Intelligenza artificiale

    GLM-5.3-Flash, Z.ai toglie la maschera a Ox Alpha

    27/08/202617 Views
    Add A Comment
    Leave A Reply Cancel Reply

    Ultimi articoli
    Omarchy 4

    Omarchy 4, la distro Linux che si installa in pochi minuti e funziona già come vuoi tu

    29/08/2026
    Audeze Maxwell 2

    Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

    29/08/2026
    MS-03 screenshot 1

    Minisforum MS-03: Panther Lake e doppia fibra 10G in meno di due litri

    29/08/2026
    TH87 ISO featured

    Epomaker TH87 ISO, tocco morbido e batteria da 10.000 mAh

    29/08/2026
    Ubuntu 26.04.1 LTS

    Ubuntu 26.04.1 LTS, il point release frenato da rust-coreutils

    28/08/202638 Views
    decine di carretti carichi di casse percorrono strade diverse che confluiscono tutte su un unico ponte di pietra, dove un uomo seduto in un casello rosso con la sbarra alzata annota il passaggio su un registro.

    Nvidia compra Hugging Face per 12,9 miliardi, e non lo fa per i 150 milioni di ricavi annuali

    27/08/202625 Views
    Gomoot : tecnologia e lifestyle
    X (Twitter) Bluesky WhatsApp Threads Mastodon
    • Home
    • Tech
    • Mobiles
    • Contatti
    • Privacy
    • ABOUT
    © 2026 GOMOOT.COM

    Type above and press Enter to search. Press Esc to cancel.