23 jezika · glas iz 15 sekundi snimka

Tekst koji progovori

Napravite audio-knjigu, vodič kroz prostor ili narativ za video — kloniranim glasom iz petnaest sekundi snimka. Najjači je na našim jezicima: srpski, crnogorski, bosanski, hrvatski.

Bez registracije za slušanje primera · 55 spremna glasa · izlaz 24 kHz

15s
Snimka za nov glas

bez treniranja, odmah

2,4×
Brže od realnog vremena

sat govora za 25 minuta

24kHz
Kvalitet izlaza

WAV i MP3

23
Jezika

srpski, crnogorski, bosanski

Zašto Slavox

Glas koji zvuči kao domaći

Veliki servisi jedan model rastežu na sedamdeset jezika. Slavox je posebno rađen za naše — srpski, crnogorski, bosanski, hrvatski — pa akcenat i rečenična melodija zvuče kao da ih izgovara neko odavde, a ne stranac koji čita.

Brzina

Brže nego što se sluša

24minuta za sat govora

Sinteza teče 2,4× brže od realnog vremena. Duži tekst se dijeli na blokove i obrađuje redom, sa vidljivom pozicijom u redu.

Glasovi

Nov glas za sekundu

15sekundi snimka je dovoljno

Glas se ne trenira — sačuva se referentni snimak i klonira pri svakom generisanju. Snimite mikrofonom, otpremite fajl ili isjecite dio sa video snimka.

Jezici

Jedan projekat, više jezika

23jezika

Najjači na južnoslovenskim; ostalo pokriva višejezična osnova. Isti glas može govoriti više jezika.

Izlaz

Spremno za montažu

24kHz, WAV i MP3

Svaki blok se preuzima zasebno ili sve odjednom kao jedan fajl, sa pauzama koje ste sami odredili.

Radi i na vašim serverima — bez slanja teksta i glasova van kuće, što je za javne ustanove, medije i škole obično uslov, a ne želja.

Zvučni primer

Poslušajte tekst

Devet blokova teksta spojenih u jedan snimak — isti glas, ujednačen tempo i pauze između rečenica od početka do kraja. Nepreuređen izlaz sistema, bez naknadne obrade.

NaratorIgor· 1 min 39 s neprekidno

Snimak sam objašnjava šta slušate: kako je nastao, od koliko sekundi reference je napravljen glas i šta se dešava kad ispravite jednu rečenicu usred teksta.

0:00—:——

Snimak je izvezen iz studija u MP3; izlaz je i WAV, 24 kHz mono.

Kako radi

Četiri koraka do gotovog snimka

Rad je organizovan kao projekat, a ne kao jedno polje za tekst — zato možete popraviti jednu rečenicu bez ponovnog generisanja svega.

  1. 01

    Uneseš tekst

    Nalepiš tekst u novi projekat — do 5.000 znakova. Bez pripreme, bez posebnog formata.

  2. 02

    Tekst se deli na blokove

    Studio sam razdvaja tekst na rečenice. Svaki blok se generiše nezavisno, pa ispravka jedne rečenice ne dira ostatak snimka.

  3. 03

    Biraš glas

    Postaviš glas za ceo projekat ili poseban glas za pojedinačni blok — za dijaloge i naizmenične govornike.

  4. 04

    Generišeš i izvoziš

    Pustiš generisanje, pratiš status blokova, biraš najbolji pokušaj i izvoziš ceo snimak kao WAV ili MP3.

Mogućnosti

Alat za posao, ne demo

Sve što je potrebno da se od teksta dođe do snimka koji možete objaviti — i da se to ponovi sutra, isto tako.

Klonirani glasovi

Otpremite referentni snimak od 2 do 60 sekundi i dobijate glas koji možete koristiti u svim projektima. Bez posebnog treninga i bez čekanja.

Blokovi sa istorijom pokušaja

Model je stohastičan — isti tekst zvuči drugačije pri svakom pokretanju. Svaki blok čuva poslednjih 10 pokušaja, pa slušate i birate onaj koji najbolje zvuči.

Glas po bloku

Podrazumevano svi blokovi nasleđuju glas projekta, ali svaki blok može dobiti svoj — dovoljno za dijaloge i naizmenične govornike u istom snimku.

Izvoz u WAV i MP3

Blokovi se spajaju u jedan snimak sa podesivim pauzama između njih. Izlaz je 24 kHz mono, spreman za montažu ili objavu.

REST API

Ceo studio radi preko dokumentovanog HTTP API-ja — projekti, blokovi, generisanje, izvoz. Ista funkcionalnost dostupna je iz vaših skripti i servisa.

On-premise

Sve radi na vašoj infrastrukturi — tekst, glasovi i snimci ne napuštaju firmu. Pristup se kontroliše preko Keycloak-a, sa rolama za korisnike i administratore.

Česta pitanja

Pitanja i odgovori

Ako nešto nije jasno, najbrži odgovor je da otvorite studio i napravite jedan projekat.

Koje jezike podržava?

23 jezika. Najjači je na našim — srpski, crnogorski, bosanski, hrvatski — jer je za njih posebno rađen, pa akcenat i glasovi č, ć, dž, đ, š, ž zvuče kao da ih izgovara neko odavde. Latinično i ćirilično pismo.

Kako se dodaje novi glas?

Otpremi se referentni snimak u trajanju od 2 do 60 sekundi i glas je odmah dostupan u svim projektima — nema posebnog treninga niti čekanja. Dodavanje i brisanje glasova radi administrator; svi ostali korisnici mogu da ih koriste.

Zašto isti tekst svaki put zvuči malo drugačije?

Model je stohastičan, kao i svi savremeni neuralni TTS sistemi — svako pokretanje daje malo drugačiju intonaciju. Zato svaki blok čuva poslednjih deset pokušaja, pa se sluša i bira najbolji umesto da se ceo snimak generiše iznova.

Koliko traje generisanje?

Brže nego što se sluša — sat govora bude gotov za oko 24 minuta, a blok od 10 sekundi za oko 4,0 sekundi. Jedan GPU obrađuje jedan blok u trenutku, a ostali čekaju u redu sa vidljivom pozicijom.

Koliki tekst mogu da obradim odjednom?

Do 5.000 znakova po projektu. Tekst se automatski deli na blokove po rečenicama, a projekata može biti koliko god je potrebno.

Da li tekst i snimci izlaze iz firme?

Ne. Sistem se postavlja na vašu infrastrukturu i radi u celosti lokalno — tekst, referentni glasovi i generisani snimci ostaju na vašim serverima. Pristup se kontroliše preko Keycloak-a, sa odvojenim rolama za korisnike i administratore.

Može li da se koristi iz sopstvene aplikacije?

Može. Studio je samo korisnički sloj nad REST API-jem — projekti, blokovi, generisanje, status i izvoz dostupni su kao obični HTTP pozivi, uz Bearer token.

Slavox na ostalim jezicima

Napravite prvi snimak za par minuta

Nalepite tekst, izaberite glas i pustite generisanje. Studio radi u pregledaču, na vašoj infrastrukturi.