Close Menu
Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Ultimi Articoli

    Rust è ora un linguaggio Tier-1 in Microsoft

    11/09/2026
    Herdr

    Herdr, guida al multiplexer di terminale per gestire più agenti AI in parallelo

    11/09/2026

    JBL Xtreme 5, il party speaker robusto con batteria rimovibile

    11/09/2026
    Astral Ascent

    Astral Ascent, un action roguelite in pixel art 

    10/09/2026

    Redmi Note 17: buona l’autonomia

    10/09/2026
    Deepseek 4.1 Flash

    Deepseek 4.1 Flash offre prestazioni agentiche elevate e prezzi competitivi

    10/09/202628 Views
    Browser Use

    Browser Use, la libreria che fa guidare il browser a un modello AI

    09/09/2026

    Ocarina of Time torna su Switch 2 a novembre

    09/09/2026
    domenica 13 Settembre 2026
    X (Twitter) Threads Mastodon Bluesky WhatsApp
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    • Home
    • Computer
      1. MINI PC
      2. Laptop
      3. Monitor
      4. Teoria
      5. Mouse
      6. GPU
      7. Windows
      8. Motherboard
      9. Tastiere
      10. View All
      AOOSTAR MACO-L 470

      AOOSTAR MACO-L, il mini PC Ryzen AI 9 HX 470 che scommette su OCuLink e memoria saldata

      05/09/2026
      MS-03 screenshot 1

      Minisforum MS-03: Panther Lake e doppia fibra 10G in meno di due litri

      29/08/2026
      NiPoGi E3B

      Mini PC NiPoGi E3B con Ryzen 7 5700U: potenza compatta ad un prezzo aggressivo

      26/03/2026

      GEEKOM A5: mini pc con buone prestazioni grazie all’AMD Ryzen 7 5800H

      26/03/2026
      Lenovo IdeaPad Slim 5x Gen 11

      Lenovo IdeaPad Slim 5x Gen 11: il 13 pollici ARM non è più un esperimento

      02/09/2026
      Slim silver ASUS Vivobook laptop open on a pastel yellow/blue abstract background.

      ASUS Vivobook Go 15, il notebook essenziale

      07/08/2026
      MacBook Neo

      MacBook Neo, il portatile entry-level di Apple

      30/03/2026
      Galaxy Book5 Pro

      Il Samsung Galaxy Book5 Pro sfida il MacBook su qualità e autonomia

      18/03/2026
      G-Master GOB2701QSC-B1

      iiyama G-Master GOB2701QSC-B1 Titan Falcon: il tandem WOLED che porta l’OLED sotto i 500 euro

      26/08/2026
      TCL27C2A

      TCL 27C2A: 1.196 zone di local dimming, il QD-Mini LED che cambia le regole del 4K

      13/07/2026
      Asus VA279QG

      ASUS VA279QG, monitor 27″ per lavoro, svago e gaming

      20/06/2026

      ASUS ROG Strix XG27AQNGV, il monitor per i competitive gamer

      05/05/2026
      Immich 3.0

      Immich 3.0, cosa cambia per chi gestisce la propria libreria fotografica

      03/07/2026
      Immich

      Immich: accelerazione GPU, ricerca CLIP multilingua e External Library

      09/05/2026
      uv astral

      Il tooling Python è sempre stato un disastro. uv risolve tutto in un colpo solo

      04/05/2026

      Mise-en-place sta cambiando il modo di gestire gli ambienti di sviluppo

      01/05/2026
      Acer wireless mouse with USB dongle on a festive gradient blue background with a gold balloon and colorful confetti pieces nearby.

      Acer, il mouse wireless ergonomico per l’uso quotidiano

      19/08/2026

      Logitech Mobi Fold è il mouse pieghevole per chi viaggia

      11/06/2026

      Logitech G Pro X2 Superstrike, il mouse con tecnologia HITS per click più veloci

      10/02/2026
      Mouse NZXT Lift 2

      Mouse NZXT Lift 2, mouse filare ultraleggero e preciso

      21/12/2025
      rtx spark

      Con RTX Spark, NVIDIA reinventa il PC Windows

      08/06/2026
      MatX

      MatX raccoglie 500 milioni di dollari per sfidare Nvidia

      25/02/2026
      nvidia rtx 5090 ti

      Nvidia prepara una RTX 5090 “estrema” per il 2026

      09/02/2026
      dlss45 MFG 6× nvidia

      NVIDIA dynamic MFG e MFG 6×: più intelligenza per i frame generati

      06/02/2026
      OptimizerDuck

      Ottimizzare Windows senza rischi con optimizerDuck

      04/08/2026
      Colorful floating Office app icons (Word, Excel, PowerPoint, Outlook) on a light blue background.

      Windows 10 ancora protetto e gratis fino a ottobre 2027

      26/06/2026
      winget configuration

      WinGet Configuration configura Windows da zero con un solo comando

      02/06/2026
      Windhawk

      Windhawk: il marketplace di mod che modella Windows 11 a tuo piacere

      28/05/2026
      ASRock B850M Challenger WiFi

      ASRock B850M Challenger WiFi: una micro-ATX AM5 che scommette su un chip BIOS da 64 MB

      24/08/2026

      Arduino UNO Q raddoppia RAM e storage

      23/01/2026
      ROG Strix B860-A Gaming

      Asus ROG Strix B860-A Gaming WiFi, motherboard per build ad alte prestazioni.

      17/01/2026
      pcie 250watt

      Asus alimenta una RTX 5060 Ti da 250 W su uno slot PCIe potenziato

      23/09/2025
      TH87 ISO featured

      Epomaker TH87 ISO, tocco morbido e batteria da 10.000 mAh

      29/08/2026
      Epomaker G84 HE

      Recensione tastiera gaming Epomaker G84 HE

      18/08/2026
      Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

      Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

      27/07/2026
      Epomaker HE75 V2

      Epomaker HE75 V2, il magnetico smette di essere una promessa

      20/06/2026

      Rust è ora un linguaggio Tier-1 in Microsoft

      11/09/2026
      AOOSTAR MACO-L 470

      AOOSTAR MACO-L, il mini PC Ryzen AI 9 HX 470 che scommette su OCuLink e memoria saldata

      05/09/2026
      Lenovo IdeaPad Slim 5x Gen 11

      Lenovo IdeaPad Slim 5x Gen 11: il 13 pollici ARM non è più un esperimento

      02/09/2026
      Omarchy 4

      Omarchy 4, la distro Linux che si installa in pochi minuti e funziona già come vuoi tu

      29/08/2026
    • Tech
      1. Curiosità
      2. Eventi
      3. memory cards
      4. Powerbank
      5. Smartwatch
      6. Gadgets
      7. Bluetooth speakers
      8. Intelligenza artificiale
      9. Offerte
      10. Software
      11. View All

      Starlink abbassa i satelliti per sicurezza orbitale

      02/01/2026

      Con Nano Banana, Gemini supera ChatGPT tra le app AI

      17/09/2025
      grotta lunare

      Scoperta una grotta lunare sotterranea

      16/07/2024
      Oleg Kononenko

      Oleg Kononenko: 1000 giorni nello spazio

      05/06/2024

      Dataland, il primo museo di arte AI al mondo apre a LA

      19/06/2026
      Google I/O 2026

      La conferenza Google I/O 2026 sarà a maggio

      18/02/2026

      NASA rinvia Artemis II per perdite di idrogeno

      03/02/2026
      BYD YangWang U9 Extreme

      BYD YangWang U9 Extreme: il nuovo re della velocità tra le auto di serie

      24/09/2025
      SSD Crucial P310 2TB

      Crucial P310 2TB SSD NVMe: storage ad alta velocità a un ottimo prezzo

      08/06/2025
      V-NAND QLC Samsung

      Il futuro dello storage è pronto: Samsung svela la V-NAND QLC da 1 Tb

      12/09/2024
      microSD SD Express

      Samsung presenta la prima microSD SD Express

      07/03/2024

      ADATA lancia il primo SSD esterno USB4 SE920

      31/10/2023
      Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

      Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

      24/07/2026
      power bank

      Power Bank cablati e wireless Qi2 : guida all’acquisto

      03/03/2026

      Anker Nano Power Bank 5K, il caricatore più sottile con MagSafe e Qi2

      22/01/2026
      Sharge ICEMAG 2

      Sharge ICEMAG 2: power bank Qi2 15W con raffreddamento attivo

      12/05/2025
      Black smartwatch with circular dial hovering above a metallic display plinth in a studio setting, showcasing its features.

      Honor Watch 6, lo smartwatch che dura settimane

      03/08/2026
      Smartwatch close-up showing a globe dial with white 09 and orange 30 on a black background with orange accents.

      OPPO Watch X3, lo smartwatch Android resistente e autonomo

      16/07/2026
      Xiaomi Watch S5

      Xiaomi Watch S5, il nuovo smartwatch in acciaio e con autonomia record

      19/06/2026

      Xiaomi Redmi Watch 6, a meno di 100 euro fa cose che non ti aspetti

      12/06/2026
      Futuristic game controller with glowing RGB ring lights, floating in an abstract, swirling background.

      EasySMX X15, il controller economico a effetto Hall

      11/08/2026
      Hue Bridge Pro

      Philips Hue Bridge Pro: novità e prestazioni del nuovo hub smart

      03/07/2026

      Blink Outdoor 4 è in offerta adesso, sorveglianza esterna senza abbonamento cloud

      22/06/2026

      WiiM Sound Lite: speaker Wi-Fi perfetto per l’audio domestico

      11/05/2026

      JBL Xtreme 5, il party speaker robusto con batteria rimovibile

      11/09/2026

      JBL Xtreme 3, altoparlante potente e impermeabile

      19/05/2026

      JBL Boombox 4: speaker Bluetooth con AI e USB-C lossless

      18/05/2026
      JBL Clip 5

      JBL Clip 5, lo speaker Bluetooth ultra-portatile e suono potente

      16/05/2026
      Deepseek 4.1 Flash

      Deepseek 4.1 Flash offre prestazioni agentiche elevate e prezzi competitivi

      10/09/2026

      Meta lancia Muse, l’agente AI che paga, prenota e negozia al tuo posto

      09/09/2026
      Mistral

      Mistral AI: tre miliardi di euro per tenere l’Europa in partita sull’intelligenza artificiale

      08/09/2026
      Astra sarà davvero il passaggio verso l'AGI che molti aspettavano ?

      GPT-6 Astra, il modello che OpenAI presenta come arrivo dell’AGI

      04/09/2026
      Ultimate Ear Wonderboom 3

      Ultimate Ears WONDERBOOM 3: suono di qualità a un prezzo accessibile

      24/03/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      nubia z60 ultra

      Offerte Black Friday Nubia: telefoni premium a prezzi convenienti

      22/11/2024
      Scream Fest 2024

      Steam Scream Fest 2024: sconti horror per Halloween

      29/10/2024
      Herdr

      Herdr, guida al multiplexer di terminale per gestire più agenti AI in parallelo

      11/09/2026
      Browser Use

      Browser Use, la libreria che fa guidare il browser a un modello AI

      09/09/2026
      ART

      ART, il RAW editor gratuito e open source

      01/09/2026
      freetoken

      FreeToken, il motore di UC Berkeley per far girare modelli MoE in locale su GPU consumer

      24/08/2026

      JBL Xtreme 5, il party speaker robusto con batteria rimovibile

      11/09/2026

      Redmi Note 17: buona l’autonomia

      10/09/2026
      Deepseek 4.1 Flash

      Deepseek 4.1 Flash offre prestazioni agentiche elevate e prezzi competitivi

      10/09/2026

      Meta lancia Muse, l’agente AI che paga, prenota e negozia al tuo posto

      09/09/2026
    • Mobiles
      1. Smartphones
      2. View All

      Redmi Note 17: buona l’autonomia

      10/09/2026
      Lavender smartphone with a triple-camera back and a stylus hovering beside it on a soft abstract background.

      Galaxy A37, il medio di gamma Samsung che convince

      06/07/2026
      Honor 400 Pro

      Honor 400 Pro: hardware da top di gamma con aggiornamenti fino al 2031

      03/07/2026
      Motorola Razr 70

      Motorola Razr 70, il pieghevole compatto ed elegante

      01/07/2026
      Tablet angled against a pastel wavy background, screen showing bright overlapping colorful circles in blue, pink, yellow.

      iPad 11, il tablet più accessibile di Apple

      08/08/2026
      Tablet with black frame displaying colorful abstract wallpaper, shown front and back against an orange–purple gradient background.

      TCL Tab A1 Plus, il tablet economico per streaming, lettura e produttività leggera

      04/08/2026
      Google Apple

      Google Health 5.05 porta la sincronizzazione bidirezionale con Apple Salute

      04/08/2026
      Oppo 5 Pad

      OPPO Pad 5, un tablet Android pensato per studio, lavoro e intrattenimento quotidiano

      29/07/2026
    • Musica
      1. Cuffie
      2. DAC
      3. hi-fi
      4. Teoria
      5. View All
      Soundcore P42i

      Soundcore P42i: auricolari ANC con LDAC e Bluetooth 6.1

      07/09/2026
      Audeze Maxwell 2

      Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

      29/08/2026
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
      Truthear KeyX

      Truthear KeyX, un DAC dongle che vale ogni centesimo

      28/04/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      FiiO BTR15

      FiiO BTR15: DAC Bluetooth al prezzo più basso di sempre

      17/05/2025

      Edifier R1280DBs, ottimi diffusori da scaffale economici

      20/06/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      Focal Aria 926

      Componenti per un ottimo impianto stereo

      31/07/2024
      truffa phishing zalando

      Truffa phishing: in regalo la gift card Zalando da 150€

      06/12/2024
      sim ed esim

      Differenza tra SIM fisica ed eSIM: vantaggi e sicurezza

      02/11/2024

      Malware: cosa sono e come difendersi

      19/10/2024
      crittografia a cosa serve

      Crittografia, come funziona e perchè dobbiamo utilizzarla

      16/10/2024
      Soundcore P42i

      Soundcore P42i: auricolari ANC con LDAC e Bluetooth 6.1

      07/09/2026
      Audeze Maxwell 2

      Audeze Maxwell 2, la cuffia planare wireless da 90 mm per gaming e musica

      29/08/2026
      White over-ear headphones with teal accents displayed on a circular pedestal against a geometric studio backdrop in a product shot.

      Logitech G325 LIGHTSPEED, cuffia gaming leggera e comoda

      10/08/2026
      Black over-ear headphones resting on a white cube pedestal against a pastel gradient backdrop with geometric shapes in the background, product shot

      Sony ULT Wear, cuffie bluetooth per amanti dei bassi forti

      05/08/2026
    • Lifestyle
      1. Criptovalute
      2. EV
      3. Gaming
      4. Trekking
      5. Scienze
      6. View All
      Alpha Arena : trading ai bot

      Alpha Arena : sfida tra modelli AI nel trading di criptovalute

      20/10/2025
      Coinbase

      Coinbase colpita da attacco informatico e minaccia di riscatto

      15/05/2025
      coinbase

      Coinbase : acquisti cripto tramite Apple Pay

      03/12/2024
      criptovalute

      Criptovalute: cosa sono e come funzionano le monete virtuali

      19/10/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
      tesla

      Tesla dice addio a Model S e Model X ma accelera sugli EV autonomi e i robot umanoidi

      29/01/2026
      Volvo EX60

      Volvo EX60: la sfida scandinava al dominio tedesco degli elettrici premium

      22/01/2026
      Astral Ascent

      Astral Ascent, un action roguelite in pixel art 

      10/09/2026

      Ocarina of Time torna su Switch 2 a novembre

      09/09/2026
      Alone with you

      Alone with You porta su PC un racconto per chi ama la fantascienza contemplativa

      03/09/2026
      Breathedge

      Breathedge, come sopravvivere nello spazio con una gallina e molto sarcasmo

      27/08/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      8a Scarpinata della Teverina

      A spasso per i sentieri: 8a Scarpinata della Teverina

      14/05/2024
      Valli e Calanchi

      A spasso per i sentieri: 1a Valli e Calanchi

      27/09/2023
      Maternum Marathon 2023

      A spasso per i sentieri: la 2a edizione di Maternum Marathon

      13/06/2023
      Il caffè riscrive il microbioma intestinale

      Il caffè riscrive il microbioma intestinale, e con esso umore, memoria e cognizione

      23/04/2026
      urano

      Le lune esterne di Urano Titania e Oberon, sono scure sul lato anteriore.

      19/06/2025
      Muon g-2

      L’anomalia Muon g-2 segue le leggi del Modello Standard

      13/06/2025
      Neuroplatform finalspark

      Neuroplatform, piattaforma online alimentata dal primo processore biologico al mondo

      27/05/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      la vita in scena

      La vita in scena, cosa resta del cinema di Vittorio De Sica

      16/06/2026

      Accordo Wizz Air e Starlink: Wi-Fi gratuito a bordo dal 2027

      09/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Home»Software»Kokoro TTS: come far leggere PDF, EPUB e articoli al tuo PC
    Software

    Kokoro TTS: come far leggere PDF, EPUB e articoli al tuo PC

    Con un container Docker e un comando da terminale, Kokoro TTS converte EPUB e PDF in file audio capitolo per capitolo, restando interamente offline
    GrazianoGraziano28/07/2026Updated:28/07/202639
    Share Twitter WhatsApp Bluesky Threads
    Kokoro
    Kokoro

    C’è una categoria di software che negli ultimi due anni è cambiata più di quanto sembri, cioè la sintesi vocale. Fino a poco tempo fa, per ottenere una voce sintetica accettabile bisognava passare da un servizio cloud a consumo, con tanto di account, chiave API e testo spedito ai server di qualcun altro. Kokoro-82M ribalta la situazione con un approccio diverso, ovvero un modello di text-to-speech con licenza Apache 2.0 che pesa poco più di 300 MB e gira senza problemi anche su un portatile privo di scheda grafica dedicata.

    Il numero nel nome indica gli 82 milioni di parametri, una cifra minuscola se paragonata ai miliardi dei sistemi vocali commerciali. Eppure la qualità in uscita regge il confronto con soluzioni molto più pesanti, e la velocità è tale che su una GPU di fascia media un libro intero viene convertito in audio in pochi minuti. Le lingue supportate sono nove, tra cui l’italiano, con oltre cinquanta voci già pronte all’uso.

    L’aspetto interessante non è però il modello in sé, quanto quello che ci puoi costruire attorno. Con due strumenti open source maturi, un server che espone API compatibili con quelle di OpenAI e un tool da riga di comando che digerisce EPUB e PDF, diventa possibile assemblare in mezz’ora una catena di lavoro che trasforma qualsiasi documento in un file audio da ascoltare ovunque, a casa, in palestra o in auto.

    In questa guida vediamo come installarlo su Windows, Linux e macOS, quanto valgono le voci italiane e quali limiti conviene conoscere prima di iniziare.

    Ottantadue milioni di parametri e nessuna GPU richiesta

    L’architettura spiega bene perché Kokoro sia così leggero. Il modello si basa su StyleTTS 2, un sistema di sintesi vocale nato da un gruppo di ricerca della Columbia University, abbinato a ISTFTNet come vocoder, cioè il componente che traduce in onda sonora vera e propria i numeri prodotti dal modello.

    La scelta tecnica decisiva è stata rinunciare alla diffusione, la stessa tecnica usata dai generatori di immagini. La diffusione produce risultati eccellenti, ma per ogni frammento di audio deve ripetere il calcolo decine di volte, partendo da un segnale casuale e ripulendolo poco alla volta. Kokoro salta tutto questo e genera l’onda sonora in un solo passaggio.

    Sui test pubblicati dal progetto Kokoro-FastAPI, misurati su una RTX 4060 Ti, il rapporto va da 35x a 100x rispetto al tempo reale, con una media di circa 137 token al secondo.

    Anche senza scheda video la cosa resta praticabile. Per produrre un’ora di parlato è necessario molto meno di un’ora, anche senza acceleratore hardware. Su un MacBook con chip M3 Pro l’attesa prima che parta la riproduzione resta sotto il secondo, mentre su un vecchio i7 desktop sale attorno ai tre secondi e mezzo, valore comunque accettabile per un ascolto non interattivo.

    Il modello è stato addestrato esclusivamente su audio di pubblico dominio o con licenze permissive, più materiale sintetico generato da sistemi commerciali chiusi. Non ci sono cloni di voci di persone reali prese senza permesso, e le fonti sono elencate una per una nella scheda del modello.

    L’intero addestramento è costato circa mille dollari di ore GPU, una cifra che dice molto su quanto sia diventato accessibile costruire modelli specializzati. La licenza Apache 2.0 copre i pesi, quindi il modello è utilizzabile anche in progetti commerciali senza vincoli particolari. Su Hugging Face viene scaricato oltre tredici milioni di volte al mese, numero che rende l’idea di quanto sia diventato popolare per la sintesi vocale in locale.

    Kokoro e le due voci italiane

    L’italiano in Kokoro esiste ed è utilizzabile, ma non è al livello dell’inglese. Le voci disponibili sono due, ovvero if_sara femminile e im_nicola maschile.

    Entrambe ricevono dagli autori del progetto un voto complessivo C, contro il B- o l’A- delle migliori voci inglesi. La ragione è semplicemente la quantità di materiale usato per l’addestramento, che per l’italiano si misura in poche ore contro le decine di ore dell’inglese.

    C’è poi una differenza tecnica che nell’uso quotidiano pesa parecchio. Prima di poter parlare, il modello deve convertire il testo scritto in fonemi, cioè nei singoli suoni che compongono le parole. Per l’inglese questo lavoro lo fa misaki, un motore sviluppato apposta dal progetto, con regole raffinate ed eccezioni gestite a mano.

    Per l’italiano, invece, Kokoro si appoggia a espeak-ng, un sintetizzatore storico e affidabile ma basato su regole più rigide. La differenza la senti subito, perché le parole italiane comuni escono pronunciate bene, mentre i termini stranieri, gli acronimi e certi nomi propri possono uscire con bassa qualità.

    Il problema si aggira con qualche accorgimento sul testo di partenza, e conviene prenderci la mano subito. Se un termine inglese ricorre spesso nel documento, sostituiscilo con una trascrizione fonetica italiana prima di dare il testo in pasto al modello.

    Per le sigle vale un trucco diverso, cioè separare le lettere con dei punti o degli spazi (A.P.I. al posto di API), così il motore le scandisce una per una anziché tentare di leggerle come parola. Un banale sed o una ricerca-sostituzione nell’editor risolvono tutto in pochi secondi.

    sed -e 's/\bAPI\b/A.P.I./g' \
        -e 's/\bsoftware\b/softuer/g' \
        -e 's/\bcloud\b/claud/g' \
        articolo.txt > articolo_pronuncia.txt
    

    Il progetto Kokoro-FastAPI pubblica una verifica automatica interessante, in cui l’audio generato viene ritrascritto con Whisper e confrontato parola per parola con il testo di partenza. La voce if_sara ottiene un tasso di errore pari a zero su frasi brevi.

    È un test limitato, e gli stessi autori lo dichiarano apertamente, ma dice almeno una cosa utile, cioè che l’italiano prodotto risulta pienamente comprensibile. Per ascoltare articoli tecnici, appunti e capitoli di libro il risultato è più che sufficiente; per un podcast destinato al pubblico, molto meno.

    La via rapida, un container e un endpoint compatibile con OpenAI

    Il modo più diretto per avere Kokoro funzionante è Kokoro-FastAPI, un progetto che impacchetta il modello dentro un server FastAPI e lo espone con lo stesso identico formato di API che OpenAI usa per la propria sintesi vocale.

    Il vantaggio è immediato. Qualsiasi programma o script già scritto per dialogare con OpenAI funziona anche con Kokoro cambiando una sola riga, quella dell’indirizzo del server. Non serve imparare una nuova libreria e non serve riscrivere nulla.

    Le immagini Docker sono già compilate per diverse architetture e contengono il modello al loro interno, quindi non c’è altro da scaricare oltre al container. Scegli quella adatta al tuo hardware.

    HardwareImmagine
    Nessuna GPU (portatile, VPS, server CPU)kokoro-fastapi-cpu:latest
    Apple Silicon M1/M2/M3kokoro-fastapi-cpu:latest
    NVIDIA GTX 9xx fino a RTX 40xxkokoro-fastapi-gpu:latest
    NVIDIA RTX serie 50 (Blackwell)kokoro-fastapi-gpu:latest-cu128
    AMD con ROCm (sperimentale)kokoro-fastapi-rocm:latest

    L’avvio richiede una riga sola.

    # Solo CPU
    docker run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu:latest
    
    # NVIDIA
    docker run --gpus all -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-gpu:latest
    
    # NVIDIA serie 50
    docker run --gpus all -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-gpu:latest-cu128
    

    A container avviato, all’indirizzo http://localhost:8880 trovi tre cose, ovvero l’API vera e propria, la documentazione interattiva su /docs e una piccola interfaccia web su /web da cui provare le voci senza scrivere una riga di codice.

    Vale la pena partire proprio da lì per i primi test. Ascoltare if_sara e im_nicola mentre leggono un paio di paragrafi tuoi è il modo più rapido per capire se il risultato ti convince, e ti evita di perdere tempo a montare una catena di lavoro attorno a una voce che poi non sopporti.

    Per generare un file audio dall’esterno bastano poche righe di Python. Il campo model va comunque valorizzato con kokoro, mentre la chiave API viene ignorata dato che il server gira in casa tua.

    from openai import OpenAI
    
    client = OpenAI(base_url="http://localhost:8880/v1", api_key="non-serve")
    
    with client.audio.speech.with_streaming_response.create(
        model="kokoro",
        voice="if_sara",
        input="Questo testo viene sintetizzato interamente sul computer locale.",
        response_format="mp3",
        speed=1.0,
    ) as response:
        response.stream_to_file("uscita.mp3")
    

    Se preferisci restare su curl senza installare librerie, il risultato non cambia.

    curl -X POST http://localhost:8880/v1/audio/speech \
      -H "Content-Type: application/json" \
      -d '{
        "model": "kokoro",
        "input": "Buongiorno, questa è una prova di sintesi vocale.",
        "voice": "if_sara",
        "response_format": "mp3",
        "speed": 1.0
      }' --output prova.mp3
    

    I formati disponibili in uscita sono MP3, WAV, Opus, FLAC, M4A e PCM. Quest’ultimo serve per riprodurre l’audio mentre viene generato, senza attendere che il file sia completo, ed è la modalità da scegliere se stai costruendo qualcosa di interattivo.

    Da EPUB ad audiolibro con un comando

    Il server è la scelta giusta per integrare la sintesi dentro altri programmi, ma per convertire documenti esiste uno strumento più adatto, ovvero kokoro-tts. È un tool da riga di comando arrivato alla versione 2.3.1 ad aprile 2026 e distribuito con licenza MIT. Legge file TXT, EPUB e PDF, riconosce i capitoli e produce un file audio separato per ciascuno.

    L’installazione passa da PyPI e conviene farla con uv, il gestore di pacchetti Python che sistema il tool in un ambiente isolato senza sporcare il resto del sistema.

    Attenzione a un dettaglio che fa perdere tempo a molti, cioè la versione di Python richiesta. Al momento servono la 3.11 o la 3.12, mentre con la 3.13 l’installazione fallisce.

    # Installazione con uv (consigliata)
    uv tool install kokoro-tts
    
    # In alternativa, con pip
    pip install kokoro-tts
    

    A differenza del container, qui il modello va scaricato a parte. Servono due file, ovvero il modello in formato ONNX e il pacchetto delle voci, ed entrambi devono trovarsi nella cartella da cui lanci il comando.

    wget https://github.com/nazdridoy/kokoro-tts/releases/download/v1.0.0/kokoro-v1.0.onnx
    wget https://github.com/nazdridoy/kokoro-tts/releases/download/v1.0.0/voices-v1.0.bin
    

    Da qui in avanti va tutto liscio. Ecco come convertire un articolo salvato in testo semplice usando la voce italiana femminile.

    kokoro-tts articolo.txt articolo.mp3 --lang it --voice if_sara --format mp3
    

    Con un libro in formato EPUB la sintassi cambia poco, ma il comportamento sì. Il tool legge l’indice del file, individua i capitoli e genera un audio separato per ognuno dentro la cartella che gli indichi.

    kokoro-tts libro.epub --split-output ./capitoli/ --lang it --voice im_nicola --format mp3
    

    I PDF funzionano allo stesso modo, con un’avvertenza importante. La suddivisione in capitoli viene ricavata dal sommario se il file ne ha uno, altrimenti dal contenuto. Su documenti con impaginazione complessa, note a piè di pagina o testo su due colonne, il risultato rischia di uscire confuso, quindi conviene convertirli prima in testo pulito con uno strumento dedicato.

    Ci sono poi due opzioni che nell’uso quotidiano fanno la differenza. La prima è --stream, che riproduce l’audio mentre viene prodotto anziché salvarlo su disco, comoda per ascoltare al volo qualcosa che ti hanno appena mandato.

    # Legge subito il contenuto degli appunti (Linux, con xclip)
    xclip -o | kokoro-tts - --stream --lang it --voice if_sara --speed 1.15
    

    La seconda è --speed, che regola la velocità di lettura. Un valore attorno a 1,15 rende l’ascolto più scorrevole senza sacrificare la naturalezza, mentre sopra 1,3 la voce inizia a suonare affrettata.

    Se hai già generato i capitoli separati e vuoi riunirli in un file unico, --merge-chunks fa il lavoro senza costringerti a passare da altri programmi.

    Kokoro: mescolare le voci e domare i blocchi di testo

    Una funzione poco pubblicizzata di Kokoro è la possibilità di fondere due voci in una terza. Le voci non sono registrazioni ma piccoli tensori, cioè insiemi di numeri che descrivono le caratteristiche del parlato, e la media pesata di due tensori produce una voce intermedia perfettamente utilizzabile.

    Sul server i pesi si indicano tra parentesi e vengono poi riproporzionati in automatico fino a sommare 100%.

    # Mix 67% / 33% tra due voci
    curl -X POST http://localhost:8880/v1/audio/speech \
      -H "Content-Type: application/json" \
      -d '{"input": "Prova di voce mista.", "voice": "if_sara(2)+im_nicola(1)", "response_format": "mp3"}' \
      --output mix.mp3
    

    Con il tool da riga di comando la stessa cosa si scrive con i due punti e le percentuali, ad esempio --voice "if_sara:60,im_nicola:40". Il risultato non è sempre migliore delle voci originali, però su testi lunghi aiuta a ottenere un timbro meno riconoscibile e in qualche caso a compensare i difetti di una delle due.

    Il secondo aspetto da conoscere riguarda la lunghezza del testo. Il modello elabora al massimo 510 token fonetici per volta, che corrispondono grosso modo a mezzo minuto di parlato, quindi qualsiasi documento più lungo va spezzato in pezzi.

    Sia il server sia il tool da terminale lo fanno per conto loro, tagliando ai confini di frase e ricucendo l’audio, ma il punto esatto in cui tagliano influisce sul risultato finale. I blocchi troppo lunghi fanno accelerare la voce verso la fine, quelli troppo corti potrebbero introdurre pause innaturali e intonazioni sbagliate.

    Sul server questi valori si controllano da variabili d’ambiente e partono da 175, 250 e 450 token.

    docker run -p 8880:8880 \
      -e TARGET_MIN_TOKENS=150 \
      -e TARGET_MAX_TOKENS=220 \
      -e ABSOLUTE_MAX_TOKENS=400 \
      ghcr.io/remsky/kokoro-fastapi-cpu:latest
    

    Se noti che la voce “corre” negli ultimi secondi di ogni frammento, abbassare TARGET_MAX_TOKENS è il primo intervento da provare.

    C’è infine un endpoint che merita attenzione se lavori con i video, ovvero /dev/captioned_speech, che restituisce l’audio insieme ai tempi di inizio e fine di ogni singola parola. Da quelle informazioni ricavare un file di sottotitoli sincronizzato richiede poche righe di codice, e questo rende Kokoro utilizzabile anche come voce fuori campo per montaggi automatici.

    Un’ultima nota riguarda un comportamento che genera parecchia confusione. Il server normalizza il testo in ingresso prima di sintetizzarlo, cioè espande numeri e simboli scrivendoli per esteso. Di solito è proprio quello che serve, ma se il tuo testo contiene notazioni particolari che vengono alterate puoi disattivare la funzione aggiungendo "normalization_options": {"normalize": false} alla richiesta.

    I confini di Kokoro e le alternative da tenere presenti

    Nessuno strumento va bene per tutto, e conviene chiarire i limiti prima di investirci tempo. Il più evidente è che Kokoro non clona voci. Puoi scegliere tra quelle incluse e mescolarle, ma non puoi dargli trenta secondi della tua voce e ottenere un modello che parla come te. È una scelta di progetto, coerente con la posizione presa sui dati di addestramento, non una mancanza tecnica destinata a essere risolta.

    Manca poi qualsiasi controllo esplicito sull’emozione o sull’enfasi. Il modello legge con un tono uniforme e piacevole, adatto alla narrazione, ma non c’è modo di chiedergli entusiasmo in una frase e gravità in quella successiva. Per leggere documenti va benissimo; per doppiare un dialogo con personaggi diversi, no.

    Il panorama del 2026 offre molte alternative, e vale la pena sapere quali sono. Chatterbox, sviluppato da Resemble AI su una base Llama da mezzo miliardo di parametri e distribuito con licenza MIT, clona una voce partendo da una decina di secondi di registrazione e offre un controllo sull’espressività, con una variante multilingua che copre oltre venti lingue. Il prezzo da pagare è un modello più pesante e una dipendenza molto più marcata dalla GPU.

    All’estremo opposto c’è Piper, che punta tutto sulla leggerezza. Gira in tempo reale persino su un Raspberry Pi 4 e copre più di trenta lingue con file per voce di pochi megabyte, però il timbro resta chiaramente sintetico e la differenza si sente.

    Kokoro occupa il punto di equilibrio più utile per l’uso personale. Se ti serve ascoltare documenti mentre fai altro, la combinazione di dimensioni contenute, licenza permissiva e velocità su hardware qualsiasi, per ora ha pochi veri concorrenti. Se invece cerchi la tua voce, o un controllo fine sull’interpretazione, Kokoro non è lo strumento giusto.

    Mezz’ora ben spesa per chi accumula letture arretrate

    Kokoro è uno di quei progetti che affrontano un problema circoscritto e lo risolvono bene, senza pretendere di diventare la piattaforma definitiva per qualcosa. Ottantadue milioni di parametri, trecento megabyte su disco, licenza Apache 2.0 e una velocità che rende irrilevante la questione della scheda video. Sono numeri che spostano la sintesi vocale dalla categoria dei servizi a pagamento a quella delle piccole utility che tieni installate e usi senza pensarci.

    Per l’italiano il quadro è meno brillante, con qualche compromesso accettabile per ascoltare un articolo o un capitolo mentre cammini; diventano un ostacolo se stai producendo qualcosa destinato ad altri.

    Il consiglio operativo, se vuoi partire senza perdere tempo, è di installare prima il container di Kokoro-FastAPI per capire se il risultato ti convince, e passare al tool da riga di comando solo se deciderari di processare libri interi. Le due strade non si escludono e metterle in piedi entrambe costa pochi minuti.

    epub kokoro pdf tts
    Previous ArticleMAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity
    Next Article Seul in caduta libera: perché il Kospi crolla e cosa c’entra la bolla dell’AI
    Avatar photo
    Graziano
    • Website

    Ho visto l'informatica nascere con il C64 e oggi seguo con lo stesso entusiasmo l'evoluzione verso mini PC e desktop SFF. Fuori dal lavoro, le mie passioni sono i film, il trekking, la bici e la corsa. Ma non disdegno una sessione di gaming o programmazione!

    Articoli collegati

    Herdr
    Software

    Herdr, guida al multiplexer di terminale per gestire più agenti AI in parallelo

    11/09/2026
    Browser Use
    Software

    Browser Use, la libreria che fa guidare il browser a un modello AI

    09/09/2026
    ART
    Software

    ART, il RAW editor gratuito e open source

    01/09/202620 Views
    Add A Comment
    Leave A Reply Cancel Reply

    Ultimi articoli

    Rust è ora un linguaggio Tier-1 in Microsoft

    11/09/2026
    Herdr

    Herdr, guida al multiplexer di terminale per gestire più agenti AI in parallelo

    11/09/2026

    JBL Xtreme 5, il party speaker robusto con batteria rimovibile

    11/09/2026
    Astral Ascent

    Astral Ascent, un action roguelite in pixel art 

    10/09/2026

    Redmi Note 17: buona l’autonomia

    10/09/2026
    Deepseek 4.1 Flash

    Deepseek 4.1 Flash offre prestazioni agentiche elevate e prezzi competitivi

    10/09/202628 Views
    Gomoot : tecnologia e lifestyle
    X (Twitter) Bluesky WhatsApp Threads Mastodon
    • Home
    • Tech
    • Mobiles
    • Contatti
    • Privacy
    • ABOUT
    © 2026 GOMOOT.COM

    Type above and press Enter to search. Press Esc to cancel.