Tekst koji
progovori
Napravite audio-knjigu, vodič kroz prostor ili narativ za video — kloniranim glasom iz petnaest sekundi snimka. Najjači je na našim jezicima: srpski, crnogorski, bosanski, hrvatski.
Bez registracije za slušanje primera · 55 spremna glasa · izlaz 24 kHz
- 15s
- Snimka za nov glas
- 2,4×
- Brže od realnog vremena
- 24kHz
- Kvalitet izlaza
- 23
- Jezika
bez treniranja, odmah
sat govora za 25 minuta
WAV i MP3
srpski, crnogorski, bosanski
Zašto Slavox
Glas koji zvuči kao domaći
Veliki servisi jedan model rastežu na sedamdeset jezika. Slavox je posebno rađen za naše — srpski, crnogorski, bosanski, hrvatski — pa akcenat i rečenična melodija zvuče kao da ih izgovara neko odavde, a ne stranac koji čita.
Brzina
Brže nego što se sluša
Sinteza teče 2,4× brže od realnog vremena. Duži tekst se dijeli na blokove i obrađuje redom, sa vidljivom pozicijom u redu.
Glasovi
Nov glas za sekundu
Glas se ne trenira — sačuva se referentni snimak i klonira pri svakom generisanju. Snimite mikrofonom, otpremite fajl ili isjecite dio sa video snimka.
Jezici
Jedan projekat, više jezika
Najjači na južnoslovenskim; ostalo pokriva višejezična osnova. Isti glas može govoriti više jezika.
Izlaz
Spremno za montažu
Svaki blok se preuzima zasebno ili sve odjednom kao jedan fajl, sa pauzama koje ste sami odredili.
Radi i na vašim serverima — bez slanja teksta i glasova van kuće, što je za javne ustanove, medije i škole obično uslov, a ne želja.
Zvučni primer
Poslušajte tekst
Devet blokova teksta spojenih u jedan snimak — isti glas, ujednačen tempo i pauze između rečenica od početka do kraja. Nepreuređen izlaz sistema, bez naknadne obrade.
Snimak sam objašnjava šta slušate: kako je nastao, od koliko sekundi reference je napravljen glas i šta se dešava kad ispravite jednu rečenicu usred teksta.
Snimak je izvezen iz studija u MP3; izlaz je i WAV, 24 kHz mono.
Kako radi
Četiri koraka do gotovog snimka
Rad je organizovan kao projekat, a ne kao jedno polje za tekst — zato možete popraviti jednu rečenicu bez ponovnog generisanja svega.
- 01
Uneseš tekst
Nalepiš tekst u novi projekat — do 5.000 znakova. Bez pripreme, bez posebnog formata.
- 02
Tekst se deli na blokove
Studio sam razdvaja tekst na rečenice. Svaki blok se generiše nezavisno, pa ispravka jedne rečenice ne dira ostatak snimka.
- 03
Biraš glas
Postaviš glas za ceo projekat ili poseban glas za pojedinačni blok — za dijaloge i naizmenične govornike.
- 04
Generišeš i izvoziš
Pustiš generisanje, pratiš status blokova, biraš najbolji pokušaj i izvoziš ceo snimak kao WAV ili MP3.
Mogućnosti
Alat za posao, ne demo
Sve što je potrebno da se od teksta dođe do snimka koji možete objaviti — i da se to ponovi sutra, isto tako.
Klonirani glasovi
Otpremite referentni snimak od 2 do 60 sekundi i dobijate glas koji možete koristiti u svim projektima. Bez posebnog treninga i bez čekanja.
Blokovi sa istorijom pokušaja
Model je stohastičan — isti tekst zvuči drugačije pri svakom pokretanju. Svaki blok čuva poslednjih 10 pokušaja, pa slušate i birate onaj koji najbolje zvuči.
Glas po bloku
Podrazumevano svi blokovi nasleđuju glas projekta, ali svaki blok može dobiti svoj — dovoljno za dijaloge i naizmenične govornike u istom snimku.
Izvoz u WAV i MP3
Blokovi se spajaju u jedan snimak sa podesivim pauzama između njih. Izlaz je 24 kHz mono, spreman za montažu ili objavu.
REST API
Ceo studio radi preko dokumentovanog HTTP API-ja — projekti, blokovi, generisanje, izvoz. Ista funkcionalnost dostupna je iz vaših skripti i servisa.
On-premise
Sve radi na vašoj infrastrukturi — tekst, glasovi i snimci ne napuštaju firmu. Pristup se kontroliše preko Keycloak-a, sa rolama za korisnike i administratore.
Česta pitanja
Pitanja i odgovori
Ako nešto nije jasno, najbrži odgovor je da otvorite studio i napravite jedan projekat.
Koje jezike podržava?
23 jezika. Najjači je na našim — srpski, crnogorski, bosanski, hrvatski — jer je za njih posebno rađen, pa akcenat i glasovi č, ć, dž, đ, š, ž zvuče kao da ih izgovara neko odavde. Latinično i ćirilično pismo.
Kako se dodaje novi glas?
Otpremi se referentni snimak u trajanju od 2 do 60 sekundi i glas je odmah dostupan u svim projektima — nema posebnog treninga niti čekanja. Dodavanje i brisanje glasova radi administrator; svi ostali korisnici mogu da ih koriste.
Zašto isti tekst svaki put zvuči malo drugačije?
Model je stohastičan, kao i svi savremeni neuralni TTS sistemi — svako pokretanje daje malo drugačiju intonaciju. Zato svaki blok čuva poslednjih deset pokušaja, pa se sluša i bira najbolji umesto da se ceo snimak generiše iznova.
Koliko traje generisanje?
Brže nego što se sluša — sat govora bude gotov za oko 24 minuta, a blok od 10 sekundi za oko 4,0 sekundi. Jedan GPU obrađuje jedan blok u trenutku, a ostali čekaju u redu sa vidljivom pozicijom.
Koliki tekst mogu da obradim odjednom?
Do 5.000 znakova po projektu. Tekst se automatski deli na blokove po rečenicama, a projekata može biti koliko god je potrebno.
Da li tekst i snimci izlaze iz firme?
Ne. Sistem se postavlja na vašu infrastrukturu i radi u celosti lokalno — tekst, referentni glasovi i generisani snimci ostaju na vašim serverima. Pristup se kontroliše preko Keycloak-a, sa odvojenim rolama za korisnike i administratore.
Može li da se koristi iz sopstvene aplikacije?
Može. Studio je samo korisnički sloj nad REST API-jem — projekti, blokovi, generisanje, status i izvoz dostupni su kao obični HTTP pozivi, uz Bearer token.
Slavox na ostalim jezicima
Napravite prvi snimak za par minuta
Nalepite tekst, izaberite glas i pustite generisanje. Studio radi u pregledaču, na vašoj infrastrukturi.