Close Menu
Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Ultimi Articoli
    Abstract color-block artwork with overlapping blue, peach, and purple shapes on a beige background.

    MAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity

    28/07/2026
    Open Secure AI Alliance partner logos featuring Adobe, Cisco, Microsoft, NVIDIA, SAP and more.

    Open Secure AI Alliance: Nvidia crea l’alleanza open source per la sicurezza AI

    27/07/2026
    Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

    Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

    27/07/2026
    Opus 5

    Claude Opus 5, intelligenza vicina al vertice a metà del prezzo di Fable 5

    25/07/2026
    Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

    Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

    24/07/2026
    Epomaker G84 HE

    La Epomaker G84 HE si distingue tra le tastiere Hall Effect economiche

    24/07/2026
    Foretales

    Foretales è una fiaba oscura giocata a carte

    24/07/2026
    Opera brand banner: purple gradient background with the Opera logo on the left and a blurred browser window preview on the right.

    Opera One introduce tab verticali e Google Lens integrato

    24/07/2026
    martedì 28 Luglio 2026
    X (Twitter) Threads Mastodon Bluesky WhatsApp
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    • Home
    • Computer
      1. MINI PC
      2. Laptop
      3. Monitor
      4. Teoria
      5. Mouse
      6. GPU
      7. Windows
      8. Motherboard
      9. Tastiere
      10. View All
      NiPoGi E3B

      Mini PC NiPoGi E3B con Ryzen 7 5700U: potenza compatta ad un prezzo aggressivo

      26/03/2026

      GEEKOM A5: mini pc con buone prestazioni grazie all’AMD Ryzen 7 5800H

      26/03/2026
      Geekom A8

      Recensione Geekom A8: il mini PC AMD che non ti aspetti

      11/03/2026
      ACEMAGICIAN S3A

      ACEMAGICIAN S3A: un mini pc per il gaming ma non solo

      09/03/2026
      MacBook Neo

      MacBook Neo, il portatile entry-level di Apple

      30/03/2026
      Galaxy Book5 Pro

      Il Samsung Galaxy Book5 Pro sfida il MacBook su qualità e autonomia

      18/03/2026
      Lenovo Chromebook Duet 11

      Lenovo Chromebook Duet 11, un versatile 2-in-1 con 10 anni di aggiornamenti

      24/12/2025
      Legion 5 15IRX10

      Lenovo Legion 5 15IRX10, potenza da workstation e versatilità gaming

      13/10/2025
      TCL27C2A

      TCL 27C2A: 1.196 zone di local dimming, il QD-Mini LED che cambia le regole del 4K

      13/07/2026
      Asus VA279QG

      ASUS VA279QG, monitor 27″ per lavoro, svago e gaming

      20/06/2026

      ASUS ROG Strix XG27AQNGV, il monitor per i competitive gamer

      05/05/2026

      Philips Evnia 27M2N6501L: il miglior monitor QD-OLED sotto i 500 euro per gaming e color grading

      14/04/2026
      Immich 3.0

      Immich 3.0, cosa cambia per chi gestisce la propria libreria fotografica

      03/07/2026
      Immich

      Immich: accelerazione GPU, ricerca CLIP multilingua e External Library

      09/05/2026
      uv astral

      Il tooling Python è sempre stato un disastro. uv risolve tutto in un colpo solo

      04/05/2026

      Mise-en-place sta cambiando il modo di gestire gli ambienti di sviluppo

      01/05/2026

      Logitech Mobi Fold è il mouse pieghevole per chi viaggia

      11/06/2026

      Logitech G Pro X2 Superstrike, il mouse con tecnologia HITS per click più veloci

      10/02/2026
      Mouse NZXT Lift 2

      Mouse NZXT Lift 2, mouse filare ultraleggero e preciso

      21/12/2025
      MX Master 4

      Logitech MX Master 4, feedback aptico e design migliorato

      20/12/2025
      rtx spark

      Con RTX Spark, NVIDIA reinventa il PC Windows

      08/06/2026
      MatX

      MatX raccoglie 500 milioni di dollari per sfidare Nvidia

      25/02/2026
      nvidia rtx 5090 ti

      Nvidia prepara una RTX 5090 “estrema” per il 2026

      09/02/2026
      dlss45 MFG 6× nvidia

      NVIDIA dynamic MFG e MFG 6×: più intelligenza per i frame generati

      06/02/2026
      Colorful floating Office app icons (Word, Excel, PowerPoint, Outlook) on a light blue background.

      Windows 10 ancora protetto e gratis fino a ottobre 2027

      26/06/2026
      winget configuration

      WinGet Configuration configura Windows da zero con un solo comando

      02/06/2026
      Windhawk

      Windhawk: il marketplace di mod che modella Windows 11 a tuo piacere

      28/05/2026
      secure boot

      Secure Boot in scadenza: cosa succede ai PC dopo il 27 giugno 2026

      06/05/2026

      Arduino UNO Q raddoppia RAM e storage

      23/01/2026
      ROG Strix B860-A Gaming

      Asus ROG Strix B860-A Gaming WiFi, motherboard per build ad alte prestazioni.

      17/01/2026
      pcie 250watt

      Asus alimenta una RTX 5060 Ti da 250 W su uno slot PCIe potenziato

      23/09/2025
      MSI MAG Z890 Tomahawk WiFi

      MSI MAG Z890 Tomahawk WiFi: scheda madre top per Intel Ultra

      12/06/2025
      Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

      Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

      27/07/2026
      Epomaker G84 HE

      La Epomaker G84 HE si distingue tra le tastiere Hall Effect economiche

      24/07/2026
      Epomaker HE75 V2

      Epomaker HE75 V2, il magnetico smette di essere una promessa

      20/06/2026

      Light Mount di be quiet! porta il silenzio nel gaming

      04/02/2026
      Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

      Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

      27/07/2026
      Epomaker G84 HE

      La Epomaker G84 HE si distingue tra le tastiere Hall Effect economiche

      24/07/2026
      Opera brand banner: purple gradient background with the Opera logo on the left and a blurred browser window preview on the right.

      Opera One introduce tab verticali e Google Lens integrato

      24/07/2026
      Orange circular logo next to a game controller and two HDMI cables on a gray tabletop surface.

      Sunshine: il tuo PC da gaming può arrivare su qualsiasi schermo di casa

      15/07/2026
    • Tech
      1. Curiosità
      2. Eventi
      3. memory cards
      4. Powerbank
      5. Smartwatch
      6. Gadgets
      7. Bluetooth speakers
      8. Intelligenza artificiale
      9. Offerte
      10. Software
      11. View All

      Starlink abbassa i satelliti per sicurezza orbitale

      02/01/2026

      Con Nano Banana, Gemini supera ChatGPT tra le app AI

      17/09/2025
      grotta lunare

      Scoperta una grotta lunare sotterranea

      16/07/2024
      Oleg Kononenko

      Oleg Kononenko: 1000 giorni nello spazio

      05/06/2024

      Dataland, il primo museo di arte AI al mondo apre a LA

      19/06/2026
      Google I/O 2026

      La conferenza Google I/O 2026 sarà a maggio

      18/02/2026

      NASA rinvia Artemis II per perdite di idrogeno

      03/02/2026
      BYD YangWang U9 Extreme

      BYD YangWang U9 Extreme: il nuovo re della velocità tra le auto di serie

      24/09/2025
      SSD Crucial P310 2TB

      Crucial P310 2TB SSD NVMe: storage ad alta velocità a un ottimo prezzo

      08/06/2025
      V-NAND QLC Samsung

      Il futuro dello storage è pronto: Samsung svela la V-NAND QLC da 1 Tb

      12/09/2024
      microSD SD Express

      Samsung presenta la prima microSD SD Express

      07/03/2024

      ADATA lancia il primo SSD esterno USB4 SE920

      31/10/2023
      Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

      Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

      24/07/2026
      power bank

      Power Bank cablati e wireless Qi2 : guida all’acquisto

      03/03/2026

      Anker Nano Power Bank 5K, il caricatore più sottile con MagSafe e Qi2

      22/01/2026
      Sharge ICEMAG 2

      Sharge ICEMAG 2: power bank Qi2 15W con raffreddamento attivo

      12/05/2025
      Smartwatch close-up showing a globe dial with white 09 and orange 30 on a black background with orange accents.

      OPPO Watch X3, lo smartwatch Android resistente e autonomo

      16/07/2026
      Xiaomi Watch S5

      Xiaomi Watch S5, il nuovo smartwatch in acciaio e con autonomia record

      19/06/2026

      Xiaomi Redmi Watch 6, a meno di 100 euro fa cose che non ti aspetti

      12/06/2026

      Amazfit Bip Max, lo smartwatch con GPS a meno di 100 euro

      02/06/2026
      Hue Bridge Pro

      Philips Hue Bridge Pro: novità e prestazioni del nuovo hub smart

      03/07/2026

      Blink Outdoor 4 è in offerta adesso, sorveglianza esterna senza abbonamento cloud

      22/06/2026

      WiiM Sound Lite: speaker Wi-Fi perfetto per l’audio domestico

      11/05/2026
      Ultimate Ear Wonderboom 3

      Ultimate Ears WONDERBOOM 3: suono di qualità a un prezzo accessibile

      24/03/2026

      JBL Xtreme 3, altoparlante potente e impermeabile

      19/05/2026

      JBL Boombox 4: speaker Bluetooth con AI e USB-C lossless

      18/05/2026
      JBL Clip 5

      JBL Clip 5, lo speaker Bluetooth ultra-portatile e suono potente

      16/05/2026
      Marshall Emberton III

      Marshall Emberton III: il re portatile del suono rock

      15/05/2026
      Abstract color-block artwork with overlapping blue, peach, and purple shapes on a beige background.

      MAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity

      28/07/2026
      Open Secure AI Alliance partner logos featuring Adobe, Cisco, Microsoft, NVIDIA, SAP and more.

      Open Secure AI Alliance: Nvidia crea l’alleanza open source per la sicurezza AI

      27/07/2026
      Opus 5

      Claude Opus 5, intelligenza vicina al vertice a metà del prezzo di Fable 5

      25/07/2026
      Colibrì

      Colibrì, il motore in puro C che fa girare GLM-5.2 sul PC di casa

      16/07/2026
      Ultimate Ear Wonderboom 3

      Ultimate Ears WONDERBOOM 3: suono di qualità a un prezzo accessibile

      24/03/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      nubia z60 ultra

      Offerte Black Friday Nubia: telefoni premium a prezzi convenienti

      22/11/2024
      Scream Fest 2024

      Steam Scream Fest 2024: sconti horror per Halloween

      29/10/2024
      Kokoro

      Kokoro TTS: come far leggere PDF, EPUB e articoli al tuo PC

      28/07/2026
      Github actions

      GitHub Actions: un server gratuito per automazioni personali senza VPS

      22/07/2026
      Colibrì

      Colibrì, il motore in puro C che fa girare GLM-5.2 sul PC di casa

      16/07/2026
      White shopping bag with a multicolored Google Play logo centered on the front.

      Google Play apre ai negozi rivali dal 22 luglio

      15/07/2026
      Abstract color-block artwork with overlapping blue, peach, and purple shapes on a beige background.

      MAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity

      28/07/2026
      Open Secure AI Alliance partner logos featuring Adobe, Cisco, Microsoft, NVIDIA, SAP and more.

      Open Secure AI Alliance: Nvidia crea l’alleanza open source per la sicurezza AI

      27/07/2026
      Opus 5

      Claude Opus 5, intelligenza vicina al vertice a metà del prezzo di Fable 5

      25/07/2026
      Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

      Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

      24/07/2026
    • Mobiles
      1. Smartphones
      2. View All
      Lavender smartphone with a triple-camera back and a stylus hovering beside it on a soft abstract background.

      Galaxy A37, il medio di gamma Samsung che convince

      06/07/2026
      Honor 400 Pro

      Honor 400 Pro: hardware da top di gamma con aggiornamenti fino al 2031

      03/07/2026
      Motorola Razr 70

      Motorola Razr 70, il pieghevole compatto ed elegante

      01/07/2026

      RedMagic 11S Pro, tanta potenza e autonomia per il re degli smartphone da gioco

      23/06/2026
      Google logo wordmark in blue, red, yellow, blue, green, and red colors on a white background.

      Backup Android: da ora Google conterà tutti i dati salvati nello spazio dell’account

      07/07/2026

      Honor MagicPad 4, il tablet Android ultrasottile che sfida l’iPad, ma costa la metà

      10/06/2026

      Note A1 NXTPAPER di TCL, un blocco note digitale per studenti e professionisti

      28/04/2026

      TCL NXTPAPER 14 è il tablet che fa riposare gli occhi

      24/04/2026
    • Musica
      1. Cuffie
      2. DAC
      3. hi-fi
      4. Teoria
      5. View All
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Two wireless over-ear headphones, one black and one light gray, displayed on a blue gradient backdrop for product showcase.

      Sennheiser Momentum 5, il nuovo wireless con suono caldo e naturale

      30/06/2026

      Moto Buds Loop, auricolari con stile aperto e suono Bose

      19/06/2026
      Turtle Beach Stealth Pro II

      Turtle Beach Stealth Pro II, cuffia da gaming per ogni piattaforma

      15/06/2026
      Truthear KeyX

      Truthear KeyX, un DAC dongle che vale ogni centesimo

      28/04/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      FiiO BTR15

      FiiO BTR15: DAC Bluetooth al prezzo più basso di sempre

      17/05/2025

      Edifier R1280DBs, ottimi diffusori da scaffale economici

      20/06/2026
      Eversolo Play

      Eversolo Play: il tuttofare hi-fi per chi vuole meno cavi e più musica

      03/12/2025
      Pioneer VSA-LX805

      Pioneer VSA-LX805, un riferimento per i ricevitori AV high-end

      08/06/2025
      Focal Aria 926

      Componenti per un ottimo impianto stereo

      31/07/2024
      truffa phishing zalando

      Truffa phishing: in regalo la gift card Zalando da 150€

      06/12/2024
      sim ed esim

      Differenza tra SIM fisica ed eSIM: vantaggi e sicurezza

      02/11/2024

      Malware: cosa sono e come difendersi

      19/10/2024
      crittografia a cosa serve

      Crittografia, come funziona e perchè dobbiamo utilizzarla

      16/10/2024
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Two wireless over-ear headphones, one black and one light gray, displayed on a blue gradient backdrop for product showcase.

      Sennheiser Momentum 5, il nuovo wireless con suono caldo e naturale

      30/06/2026

      Edifier R1280DBs, ottimi diffusori da scaffale economici

      20/06/2026

      Moto Buds Loop, auricolari con stile aperto e suono Bose

      19/06/2026
    • Lifestyle
      1. Criptovalute
      2. EV
      3. Gaming
      4. Trekking
      5. Scienze
      6. View All
      Alpha Arena : trading ai bot

      Alpha Arena : sfida tra modelli AI nel trading di criptovalute

      20/10/2025
      Coinbase

      Coinbase colpita da attacco informatico e minaccia di riscatto

      15/05/2025
      coinbase

      Coinbase : acquisti cripto tramite Apple Pay

      03/12/2024
      criptovalute

      Criptovalute: cosa sono e come funzionano le monete virtuali

      19/10/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
      tesla

      Tesla dice addio a Model S e Model X ma accelera sugli EV autonomi e i robot umanoidi

      29/01/2026
      Volvo EX60

      Volvo EX60: la sfida scandinava al dominio tedesco degli elettrici premium

      22/01/2026
      Foretales

      Foretales è una fiaba oscura giocata a carte

      24/07/2026
      Luto

      Luto, la casa come prigione del dolore

      16/07/2026
      Orange circular logo next to a game controller and two HDMI cables on a gray tabletop surface.

      Sunshine: il tuo PC da gaming può arrivare su qualsiasi schermo di casa

      15/07/2026
      Corsair HS35 v3

      Corsair HS35 v3, la terza generazione dell’entry level convince ancora

      13/07/2026
      Samsung Galaxy Watch 5

      Samsung Galaxy Watch 5 in offerta

      03/01/2025
      8a Scarpinata della Teverina

      A spasso per i sentieri: 8a Scarpinata della Teverina

      14/05/2024
      Valli e Calanchi

      A spasso per i sentieri: 1a Valli e Calanchi

      27/09/2023
      Maternum Marathon 2023

      A spasso per i sentieri: la 2a edizione di Maternum Marathon

      13/06/2023
      Il caffè riscrive il microbioma intestinale

      Il caffè riscrive il microbioma intestinale, e con esso umore, memoria e cognizione

      23/04/2026
      urano

      Le lune esterne di Urano Titania e Oberon, sono scure sul lato anteriore.

      19/06/2025
      Muon g-2

      L’anomalia Muon g-2 segue le leggi del Modello Standard

      13/06/2025
      Neuroplatform finalspark

      Neuroplatform, piattaforma online alimentata dal primo processore biologico al mondo

      27/05/2024

      CATL lancia TENER Sodium, l’accumulo al sodio per la rete

      23/06/2026
      la vita in scena

      La vita in scena, cosa resta del cinema di Vittorio De Sica

      16/06/2026

      Accordo Wizz Air e Starlink: Wi-Fi gratuito a bordo dal 2027

      09/06/2026
      CATL e HyperStrong

      CATL e HyperStrong: l’accordo da 60 GWh che porta le batterie al sodio nell’era industriale

      29/04/2026
    Gomoot : tecnologia e lifestyleGomoot : tecnologia e lifestyle
    Home»Software»Kokoro TTS: come far leggere PDF, EPUB e articoli al tuo PC
    Software

    Kokoro TTS: come far leggere PDF, EPUB e articoli al tuo PC

    Con un container Docker e un comando da terminale, Kokoro TTS converte EPUB e PDF in file audio capitolo per capitolo, restando interamente offline
    GrazianoGraziano28/07/2026
    Share Twitter WhatsApp Bluesky Threads
    Kokoro
    Kokoro

    C’è una categoria di software che negli ultimi due anni è cambiata più di quanto sembri, cioè la sintesi vocale. Fino a poco tempo fa, per ottenere una voce sintetica accettabile bisognava passare da un servizio cloud a consumo, con tanto di account, chiave API e testo spedito ai server di qualcun altro.

    Kokoro-82M ribalta la situazione con un approccio diverso, ovvero un modello di text-to-speech con licenza Apache 2.0 che pesa poco più di 300 MB e gira senza problemi anche su un portatile privo di scheda grafica dedicata.

    Il numero nel nome indica gli 82 milioni di parametri, una cifra minuscola se paragonata ai miliardi dei sistemi vocali commerciali. Eppure la qualità in uscita regge il confronto con soluzioni molto più pesanti, e la velocità è tale che su una GPU di fascia media un libro intero viene convertito in audio in pochi minuti. Le lingue supportate sono nove, tra cui l’italiano, con oltre cinquanta voci già pronte all’uso.

    L’aspetto interessante non è però il modello in sé, quanto quello che ci puoi costruire attorno. Con due strumenti open source maturi, un server che espone API compatibili con quelle di OpenAI e un tool da riga di comando che digerisce EPUB e PDF, diventa possibile assemblare in mezz’ora una catena di lavoro che trasforma qualsiasi documento in un file audio da ascoltare ovunque, a casa, in palestra o in auto.

    In questa guida vediamo come installarlo su Windows, Linux e macOS, quanto valgono le voci italiane e quali limiti conviene conoscere prima di iniziare.

    Ottantadue milioni di parametri e nessuna GPU richiesta

    L’architettura spiega bene perché Kokoro sia così leggero. Il modello si basa su StyleTTS 2, un sistema di sintesi vocale nato da un gruppo di ricerca della Columbia University, abbinato a ISTFTNet come vocoder, cioè il componente che traduce in onda sonora vera e propria i numeri prodotti dal modello.

    La scelta tecnica decisiva è stata rinunciare alla diffusione, la stessa tecnica usata dai generatori di immagini. La diffusione produce risultati eccellenti, ma per ogni frammento di audio deve ripetere il calcolo decine di volte, partendo da un segnale casuale e ripulendolo poco alla volta. Kokoro salta tutto questo e genera l’onda sonora in un solo passaggio.

    Il risultato è che la sintesi va molto più veloce del tempo reale anche senza acceleratore hardware, ovvero produrre un’ora di parlato richiede molto meno di un’ora. Sui test pubblicati dal progetto Kokoro-FastAPI, misurati su una RTX 4060 Ti, il rapporto va da 35x a 100x rispetto al tempo reale, con una media di circa 137 token al secondo.

    Anche senza scheda video la cosa resta praticabile. Su un MacBook con chip M3 Pro l’attesa prima che parta la riproduzione resta sotto il secondo, mentre su un vecchio i7 desktop sale attorno ai tre secondi e mezzo, valore comunque accettabile per un ascolto non interattivo.

    Il modello è stato addestrato esclusivamente su audio di pubblico dominio o con licenze permissive, più materiale sintetico generato da sistemi commerciali chiusi. Non ci sono cloni di voci di persone reali prese senza permesso, e le fonti sono elencate una per una nella scheda del modello.

    L’intero addestramento è costato circa mille dollari di ore GPU, una cifra che dice molto su quanto sia diventato accessibile costruire modelli specializzati. La licenza Apache 2.0 copre i pesi, quindi il modello è utilizzabile anche in progetti commerciali senza vincoli particolari. Su Hugging Face viene scaricato oltre tredici milioni di volte al mese, numero che rende l’idea di quanto sia diventato popolare per la sintesi vocale in locale.

    Kokoro e le due voci italiane

    L’italiano in Kokoro esiste ed è utilizzabile, ma non è al livello dell’inglese. Le voci disponibili sono due, ovvero if_sara femminile e im_nicola maschile.

    Entrambe ricevono dagli autori del progetto un voto complessivo C, contro il B- o l’A- delle migliori voci inglesi. La ragione è semplicemente la quantità di materiale usato per l’addestramento, che per l’italiano si misura in poche ore contro le decine di ore dell’inglese.

    C’è poi una differenza tecnica che nell’uso quotidiano pesa parecchio. Prima di poter parlare, il modello deve convertire il testo scritto in fonemi, cioè nei singoli suoni che compongono le parole. Per l’inglese questo lavoro lo fa misaki, un motore sviluppato apposta dal progetto, con regole raffinate ed eccezioni gestite a mano.

    Per l’italiano, invece, Kokoro si appoggia a espeak-ng, un sintetizzatore storico e affidabile ma basato su regole più rigide. La differenza la senti subito, perché le parole italiane comuni escono pronunciate bene, mentre i termini stranieri, gli acronimi e certi nomi propri possono uscire con bassa qualità.

    Il problema si aggira con qualche accorgimento sul testo di partenza, e conviene prenderci la mano subito. Se un termine inglese ricorre spesso nel documento, sostituiscilo con una trascrizione fonetica italiana prima di dare il testo in pasto al modello.

    Per le sigle vale un trucco diverso, cioè separare le lettere con dei punti o degli spazi (A.P.I. al posto di API), così il motore le scandisce una per una anziché tentare di leggerle come parola. Un banale sed o una ricerca-sostituzione nell’editor risolvono in pochi secondi.

    sed -e 's/\bAPI\b/A.P.I./g' \
        -e 's/\bsoftware\b/softuer/g' \
        -e 's/\bcloud\b/claud/g' \
        articolo.txt > articolo_pronuncia.txt
    

    Il progetto Kokoro-FastAPI pubblica una verifica automatica interessante, in cui l’audio generato viene ritrascritto con Whisper e confrontato parola per parola con il testo di partenza. La voce if_sara ottiene un tasso di errore pari a zero su frasi brevi.

    È un test limitato, e gli stessi autori lo dichiarano apertamente, ma dice almeno una cosa utile, cioè che l’italiano prodotto risulta pienamente comprensibile. Per ascoltare articoli tecnici, appunti e capitoli di libro il risultato è più che sufficiente; per un podcast destinato al pubblico, molto meno.

    La via rapida, un container e un endpoint compatibile con OpenAI

    Il modo più diretto per avere Kokoro funzionante è Kokoro-FastAPI, un progetto che impacchetta il modello dentro un server FastAPI e lo espone con lo stesso identico formato di API che OpenAI usa per la propria sintesi vocale.

    Il vantaggio è immediato. Qualsiasi programma o script già scritto per dialogare con OpenAI funziona anche con Kokoro cambiando una sola riga, quella dell’indirizzo del server. Non serve imparare una nuova libreria e non serve riscrivere nulla.

    Le immagini Docker sono già compilate per diverse architetture e contengono il modello al loro interno, quindi non c’è altro da scaricare oltre al container. Scegli quella adatta al tuo hardware.

    HardwareImmagine
    Nessuna GPU (portatile, VPS, server CPU)kokoro-fastapi-cpu:latest
    Apple Silicon M1/M2/M3kokoro-fastapi-cpu:latest
    NVIDIA GTX 9xx fino a RTX 40xxkokoro-fastapi-gpu:latest
    NVIDIA RTX serie 50 (Blackwell)kokoro-fastapi-gpu:latest-cu128
    AMD con ROCm (sperimentale)kokoro-fastapi-rocm:latest

    L’avvio richiede una riga sola.

    # Solo CPU
    docker run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu:latest
    
    # NVIDIA
    docker run --gpus all -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-gpu:latest
    
    # NVIDIA serie 50
    docker run --gpus all -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-gpu:latest-cu128
    

    A container avviato, all’indirizzo http://localhost:8880 trovi tre cose, ovvero l’API vera e propria, la documentazione interattiva su /docs e una piccola interfaccia web su /web da cui provare le voci senza scrivere una riga di codice.

    Vale la pena partire proprio da lì per i primi test. Ascoltare if_sara e im_nicola mentre leggono un paio di paragrafi tuoi è il modo più rapido per capire se il risultato ti convince, e ti evita di perdere tempo a montare una catena di lavoro attorno a una voce che poi non sopporti.

    Per generare un file audio dall’esterno bastano poche righe di Python. Il campo model va comunque valorizzato con kokoro, mentre la chiave API viene ignorata dato che il server gira in casa tua.

    from openai import OpenAI
    
    client = OpenAI(base_url="http://localhost:8880/v1", api_key="non-serve")
    
    with client.audio.speech.with_streaming_response.create(
        model="kokoro",
        voice="if_sara",
        input="Questo testo viene sintetizzato interamente sul computer locale.",
        response_format="mp3",
        speed=1.0,
    ) as response:
        response.stream_to_file("uscita.mp3")
    

    Se preferisci restare su curl senza installare librerie, il risultato non cambia.

    curl -X POST http://localhost:8880/v1/audio/speech \
      -H "Content-Type: application/json" \
      -d '{
        "model": "kokoro",
        "input": "Buongiorno, questa è una prova di sintesi vocale.",
        "voice": "if_sara",
        "response_format": "mp3",
        "speed": 1.0
      }' --output prova.mp3
    

    I formati disponibili in uscita sono MP3, WAV, Opus, FLAC, M4A e PCM. Quest’ultimo serve per riprodurre l’audio mentre viene generato, senza attendere che il file sia completo, ed è la modalità da scegliere se stai costruendo qualcosa di interattivo.

    Da EPUB ad audiolibro con un comando

    Il server è la scelta giusta per integrare la sintesi dentro altri programmi, ma per convertire documenti esiste uno strumento più adatto, ovvero kokoro-tts. È un tool da riga di comando arrivato alla versione 2.3.1 ad aprile 2026 e distribuito con licenza MIT. Legge file TXT, EPUB e PDF, riconosce i capitoli e produce un file audio separato per ciascuno.

    L’installazione passa da PyPI e conviene farla con uv, il gestore di pacchetti Python che sistema il tool in un ambiente isolato senza sporcare il resto del sistema.

    Attenzione a un dettaglio che fa perdere tempo a molti, cioè la versione di Python richiesta. Al momento servono la 3.11 o la 3.12, mentre con la 3.13 l’installazione fallisce.

    # Installazione con uv (consigliata)
    uv tool install kokoro-tts
    
    # In alternativa, con pip
    pip install kokoro-tts
    

    A differenza del container, qui il modello va scaricato a parte. Servono due file, ovvero il modello in formato ONNX e il pacchetto delle voci, ed entrambi devono trovarsi nella cartella da cui lanci il comando.

    wget https://github.com/nazdridoy/kokoro-tts/releases/download/v1.0.0/kokoro-v1.0.onnx
    wget https://github.com/nazdridoy/kokoro-tts/releases/download/v1.0.0/voices-v1.0.bin
    

    Da qui in avanti va tutto liscio. Ecco come convertire un articolo salvato in testo semplice usando la voce italiana femminile.

    kokoro-tts articolo.txt articolo.mp3 --lang it --voice if_sara --format mp3
    

    Con un libro in formato EPUB la sintassi cambia poco, ma il comportamento sì. Il tool legge l’indice del file, individua i capitoli e genera un audio separato per ognuno dentro la cartella che gli indichi.

    kokoro-tts libro.epub --split-output ./capitoli/ --lang it --voice im_nicola --format mp3
    

    I PDF funzionano allo stesso modo, con un’avvertenza importante. La suddivisione in capitoli viene ricavata dal sommario se il file ne ha uno, altrimenti dal contenuto. Su documenti con impaginazione complessa, note a piè di pagina o testo su due colonne, il risultato rischia di uscire confuso, quindi conviene convertirli prima in testo pulito con uno strumento dedicato.

    Ci sono poi due opzioni che nell’uso quotidiano fanno la differenza. La prima è --stream, che riproduce l’audio mentre viene prodotto anziché salvarlo su disco, comoda per ascoltare al volo qualcosa che ti hanno appena mandato.

    # Legge subito il contenuto degli appunti (Linux, con xclip)
    xclip -o | kokoro-tts - --stream --lang it --voice if_sara --speed 1.15
    

    La seconda è --speed, che regola la velocità di lettura. Un valore attorno a 1,15 rende l’ascolto più scorrevole senza sacrificare la naturalezza, mentre sopra 1,3 la voce inizia a suonare affrettata.

    Se hai già generato i capitoli separati e vuoi riunirli in un file unico, --merge-chunks fa il lavoro senza costringerti a passare da altri programmi.

    Kokoro: mescolare le voci e domare i blocchi di testo

    Una funzione poco pubblicizzata di Kokoro è la possibilità di fondere due voci in una terza. Le voci non sono registrazioni ma piccoli tensori, cioè insiemi di numeri che descrivono le caratteristiche del parlato, e la media pesata di due tensori produce una voce intermedia perfettamente utilizzabile.

    Sul server i pesi si indicano tra parentesi e vengono poi riproporzionati in automatico fino a sommare 100%.

    # Mix 67% / 33% tra due voci
    curl -X POST http://localhost:8880/v1/audio/speech \
      -H "Content-Type: application/json" \
      -d '{"input": "Prova di voce mista.", "voice": "if_sara(2)+im_nicola(1)", "response_format": "mp3"}' \
      --output mix.mp3
    

    Con il tool da riga di comando la stessa cosa si scrive con i due punti e le percentuali, ad esempio --voice "if_sara:60,im_nicola:40". Il risultato non è sempre migliore delle voci originali, però su testi lunghi aiuta a ottenere un timbro meno riconoscibile e in qualche caso a compensare i difetti di una delle due.

    Il secondo aspetto da conoscere riguarda la lunghezza del testo. Il modello elabora al massimo 510 token fonetici per volta, che corrispondono grosso modo a mezzo minuto di parlato, quindi qualsiasi documento più lungo va spezzato in pezzi.

    Sia il server sia il tool da terminale lo fanno per conto loro, tagliando ai confini di frase e ricucendo l’audio, ma il punto esatto in cui tagliano influisce sul risultato finale. I blocchi troppo lunghi fanno accelerare la voce verso la fine, quelli troppo corti potrebbero introdurre pause innaturali e intonazioni sbagliate.

    Sul server questi valori si controllano da variabili d’ambiente e partono da 175, 250 e 450 token.

    docker run -p 8880:8880 \
      -e TARGET_MIN_TOKENS=150 \
      -e TARGET_MAX_TOKENS=220 \
      -e ABSOLUTE_MAX_TOKENS=400 \
      ghcr.io/remsky/kokoro-fastapi-cpu:latest
    

    Se noti che la voce “corre” negli ultimi secondi di ogni frammento, abbassare TARGET_MAX_TOKENS è il primo intervento da provare.

    C’è infine un endpoint che merita attenzione se lavori con i video, ovvero /dev/captioned_speech, che restituisce l’audio insieme ai tempi di inizio e fine di ogni singola parola. Da quelle informazioni ricavare un file di sottotitoli sincronizzato richiede poche righe di codice, e questo rende Kokoro utilizzabile anche come voce fuori campo per montaggi automatici.

    Un’ultima nota riguarda un comportamento che genera parecchia confusione. Il server normalizza il testo in ingresso prima di sintetizzarlo, cioè espande numeri e simboli scrivendoli per esteso. Di solito è proprio quello che serve, ma se il tuo testo contiene notazioni particolari che vengono alterate puoi disattivare la funzione aggiungendo "normalization_options": {"normalize": false} alla richiesta.

    I confini di Kokoro e le alternative da tenere presenti

    Nessuno strumento va bene per tutto, e conviene chiarire i limiti prima di investirci tempo. Il più evidente è che Kokoro non clona voci. Puoi scegliere tra quelle incluse e mescolarle, ma non puoi dargli trenta secondi della tua voce e ottenere un modello che parla come te.

    È una scelta di progetto, coerente con la posizione presa sui dati di addestramento, non una mancanza tecnica destinata a essere risolta.

    Manca poi qualsiasi controllo esplicito sull’emozione o sull’enfasi. Il modello legge con un tono uniforme e piacevole, adatto alla narrazione, ma non c’è modo di chiedergli entusiasmo in una frase e gravità in quella successiva. Per leggere documenti va benissimo; per doppiare un dialogo con personaggi diversi, no.

    Il panorama del 2026 offre molte alternative, e vale la pena sapere quali sono. Chatterbox, sviluppato da Resemble AI su una base Llama da mezzo miliardo di parametri e distribuito con licenza MIT, clona una voce partendo da una decina di secondi di registrazione e offre un controllo sull’espressività, con una variante multilingua che copre oltre venti lingue. Il prezzo da pagare è un modello più pesante e una dipendenza molto più marcata dalla GPU.

    All’estremo opposto c’è Piper, che punta tutto sulla leggerezza. Gira in tempo reale persino su un Raspberry Pi 4 e copre più di trenta lingue con file per voce di pochi megabyte, però il timbro resta chiaramente sintetico e la differenza si sente.

    La mia lettura è che Kokoro occupi il punto di equilibrio più utile per l’uso personale. Se ti serve ascoltare documenti mentre fai altro, la combinazione di dimensioni contenute, licenza permissiva e velocità su hardware qualsiasi ha per ora pochi veri concorrenti. Se invece cerchi la tua voce, o un controllo fine sull’interpretazione, Kokoro non è lo strumento giusto.

    Mezz’ora ben spesa per chi accumula letture arretrate

    Kokoro è uno di quei progetti che affrontano un problema circoscritto e lo risolvono bene, senza pretendere di diventare la piattaforma definitiva per qualcosa. Ottantadue milioni di parametri, trecento megabyte su disco, licenza Apache 2.0 e una velocità che rende irrilevante la questione della scheda video. Sono numeri che spostano la sintesi vocale dalla categoria dei servizi a pagamento a quella delle piccole utility che tieni installate e usi senza pensarci.

    Per l’italiano il quadro è meno brillante con qualche compromesso accettabile per ascoltare un articolo o un capitolo mentre cammini; diventano un ostacolo se stai producendo qualcosa destinato ad altri.

    Il consiglio operativo, se vuoi partire senza perdere tempo, è di installare prima il container di Kokoro-FastAPI per capire se il risultato ti convince, e passare al tool da riga di comando solo se deciderari di processare libri interi. Le due strade non si escludono e metterle in piedi entrambe costa pochi minuti.

    epub kokoro pdf tts
    Previous ArticleMAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity
    Avatar photo
    Graziano
    • Website

    Ho visto l'informatica nascere con il C64 e oggi seguo con lo stesso entusiasmo l'evoluzione verso mini PC e desktop SFF. Fuori dal lavoro, le mie passioni sono i film, il trekking, la bici e la corsa. Ma non disdegno una sessione di gaming o programmazione!

    Articoli collegati

    Github actions
    Software

    GitHub Actions: un server gratuito per automazioni personali senza VPS

    22/07/202631 Views
    Colibrì
    Intelligenza artificiale

    Colibrì, il motore in puro C che fa girare GLM-5.2 sul PC di casa

    16/07/202659 Views
    White shopping bag with a multicolored Google Play logo centered on the front.
    Software

    Google Play apre ai negozi rivali dal 22 luglio

    15/07/202616 Views
    Add A Comment
    Leave A Reply Cancel Reply

    Ultimi articoli
    Abstract color-block artwork with overlapping blue, peach, and purple shapes on a beige background.

    MAI-Cyber-1-Flash, il nuovo modello Microsoft per la cybersecurity

    28/07/2026
    Open Secure AI Alliance partner logos featuring Adobe, Cisco, Microsoft, NVIDIA, SAP and more.

    Open Secure AI Alliance: Nvidia crea l’alleanza open source per la sicurezza AI

    27/07/2026
    Mechanical keyboard with blue keycaps resting on a rocky surface in a dark setting.

    Keychron Q6 HE 8K, tastiera magnetica full-size per lavoro e gaming

    27/07/2026
    Opus 5

    Claude Opus 5, intelligenza vicina al vertice a metà del prezzo di Fable 5

    25/07/2026
    Copper-colored iPhone with triple-camera system and Apple logo, shown with a black iPhone above. (Back view)

    Baseus PicoGo AM52, la power bank magnetica con ricarica wireless Qi2.2

    24/07/2026
    Epomaker G84 HE

    La Epomaker G84 HE si distingue tra le tastiere Hall Effect economiche

    24/07/2026
    Gomoot : tecnologia e lifestyle
    X (Twitter) Bluesky WhatsApp Threads Mastodon
    • Home
    • Tech
    • Mobiles
    • Contatti
    • Privacy
    • ABOUT
    © 2026 GOMOOT.COM

    Type above and press Enter to search. Press Esc to cancel.