Francuska AI kompanija Mistral predstavila je novi model veštačke inteligencije za generisanje govora pod nazivom Voxtral TTS. Ovaj alat otvorenog koda namenjen je preduzećima koja žele da razvijaju sopstvene glasovne asistente za prodaju ili korisničku podršku, čime Mistral direktno ulazi na teritoriju giganata kao što su ElevenLabs, Deepgram i OpenAI.
Ključna prednost novog modela je njegova efikasnost i mogućnost prilagođavanja specifičnim potrebama klijenata, uz značajno niže troškove eksploatacije u poređenju sa trenutnim rešenjima na tržištu.
Devet jezika i zvuk koji nije robotski
Voxtral TTS trenutno podržava devet svetskih jezika uključujući engleski, francuski, nemački, španski, holandski, portugalski, italijanski, hindi i arapski. Prema rečima Pjera Stoka iz kompanije Mistral, cilj je bio razviti model koji zvuči prirodno i ljudski, izbegavajući hladne i robotske tonove koji su do sada bili karakteristični za jeftinije sisteme.
Evo šta ovaj model izdvaja od konkurencije:
- Ekstremno brzo kloniranje: Sistem može da kreira prilagođen glas na osnovu uzorka kraćeg od pet sekundi.
- Precizna intonacija: Voxtral uspešno hvata suptilne akcente, promene u visini glasa i prirodne nepravilnosti u protoku govora.
- Multilingvalna stabilnost: Model može lako da prelazi sa jednog jezika na drugi bez gubitka osnovnih karakteristika glasa, što je idealno za sinhronizaciju i prevođenje u realnom vremenu.
Performanse prilagođene „Edge“ uređajima
Voxtral TTS je zasnovan na Ministral 3B arhitekturi i dizajniran je tako da može da funkcioniše direktno na uređajima kao što su pametni satovi, telefoni ili laptopovi bez potrebe za stalnom vezom sa moćnim serverima.
Kada je reč o brzini, model pokazuje impresivne rezultate. Vreme do prvog audio zapisa (TTFA) iznosi svega 90 milisekundi za uzorak od 500 karaktera, dok je faktor realnog vremena (RTF) deklarisan na 6x. To u praksi znači da sistem može da izgeneriše deset sekundi govora za otprilike 1,6 sekundi.
Vizija o multimodalnoj platformi
Lansiranjem ovog modela Mistral polako zaokružuje svoju ponudu glasovnih proizvoda za poslovne korisnike. Nakon modela za transkripciju predstavljenih početkom godine, Voxtral TTS predstavlja važan deo slagalice u kreiranju kompletne platforme. Dugoročni plan kompanije je razvoj sistema koji će istovremeno obrađivati zvuk, tekst i slike, pružajući korisnicima informacije kroz sve dostupne kanale komunikacije.
Budući da je kod otvorenog koda, kompanije će moći same da treniraju i fino podešavaju model prema svojim potrebama, što Mistralu daje značajnu prednost u trci za poverenje korporativnog sektora.





