Hangjegyzet szöveggé, ingyen
Húzd be a hangfelvételt, vagy vedd fel itt helyben: a beszédfelismerés a böngésződben fut, a szöveget bekezdésekre bontva kapod, átírhatod, és letöltheted TXT-ként vagy Markdownként.
Húzd ide a hangfelvételt
M4A, MP3, WAV, OGG, Opus, WebM és videófájlok is — legfeljebb 500 MB és 2 óra. A felvétel a böngésződben marad, nem töltjük fel sehová.
Hogyan lesz a hangfelvételből jegyzet?
Három lépésben. Először a felvételt 16 kHz-es, egycsatornás hanggá alakítjuk — ezen a formátumon dolgozik a beszédfelismerő modell, és ide fér bele a diktafonos m4a, az üzenetküldőből mentett opus, az mp3, a wav és a videóból származó hang is. Ezután a hangot harmincmásodperces ablakokban átfuttatjuk a Whisper nevű nyílt modellen, amely nemcsak a szavakat adja vissza, hanem azt is, mikor hangzottak el. Végül a szótöredékeket nem feliratsorokká, hanem bekezdésekké fűzzük össze: ott vágunk, ahol legalább másfél másodperc szünet van, vagy ahol egy mondat véget ér és a bekezdés már elég hosszú.
Ez a bekezdésre bontás a különbség a felirat és a jegyzet között. Egy feliratsor hatszavas, mert annyi fér ki a képernyőre; egy jegyzetben harminc ilyen sor olvashatatlan. Az exportban ezért időbélyeg sincs sehol: a TXT és a Markdown fájlt beilleszted a jegyzetelődbe, és az úgy néz ki, mintha begépelted volna. Az időzítés a szerkesztőben marad, ahol dolga van — rákattintasz egy bekezdésre, és onnan indul a lejátszás.
Mindez a te gépeden történik. A felvétel nem kerül fel szerverre, és a szöveg sem: az oldal betöltése után akár offline is végigmenne a feldolgozás. Ennek az ára az első futás — a modellt le kell tölteni, és az több tíz megabájt. Utána a böngésződ gyorsítótárában marad, a következő felvételnél már nem ismétlődik.
Mire jó a gyakorlatban
Diktált jegyzet. Vezetés vagy séta közben felmondasz egy gondolatmenetet, itt pedig kereshető, másolható szöveg lesz belőle. A felvétel a telefonodon marad, a szöveg a böngésződben készül.
Megbeszélés és interjú. Egy órányi felvételből pár perc alatt nyers leirat lesz, amit már át lehet olvasni. Több beszélőt nem különböztetünk meg — ha ez kell, a bekezdéseket kézzel jelölöd meg, és a szerkesztő pont ezért engedi átírni mindet.
Hangüzenetek. Egy hosszú hangüzenetet gyorsabb elolvasni, mint végighallgatni — és ott is, ahol nem tudsz hangot lejátszani. Az üzenetküldőkből mentett opus és m4a fájlokat közvetlenül behúzhatod.
Hol vannak a határai
Őszintén: ez a legkisebb Whisper-modell, mert csak ez fér el egy böngészőben. Tiszta, közeli angol beszédnél nagyon jó, magyarnál érezhetően gyengébb — a tulajdonneveket és a szakszavakat gyakran elrontja, az írásjelek pedig esetlegesek. A leirat nyersanyag, nem kész szöveg; ezért szerkeszthető minden bekezdés.
Zajos környezet, egymásra beszélő emberek, távoli mikrofon és erős akcentus mind rontja az eredményt. Beszélőket nem választunk szét, és összefoglalót sem készítünk. A sebesség a gépedtől függ: öt perc hang egy mai asztali gépen húsz-harminc másodperc, telefonon a többszöröse.
Gyakori kérdések
Feltöltődik valahová a hangfelvételem?
Nem. Sem a felvétel, sem a leirat. Csak akkor kerül fel bármi, ha te magad a „Mentés a FileMv-be" gombra kattintasz, hogy linket kapj a jegyzethez.
Ingyenes, és van perckorlát?
Ingyenes, regisztráció nélkül, és nincs havi perckeret — a feldolgozás a te gépeden fut, nekünk nem kerül semmibe. Egy felvétel legfeljebb 500 MB és 2 óra lehet.
Készít összefoglalót?
Nem, és ezt szándékosan hagytuk ki. Egy böngészőben futó nyelvi modell további több száz megabájt letöltés lenne, és a hibázása itt a legrosszabb fajta: hihetően összefoglal olyat is, ami el sem hangzott. A kész szöveget másold be abba az eszközbe, amelyikben megbízol.
Mennyi az az első letöltés?
A beszédfelismerő modell és a futtatókörnyezet együtt 54–72 MB, attól függően, hogy a böngésződ tudja-e használni a videokártyát. Ehhez jön a hangátalakító, további 31 MB. Mindez egyszeri: utána a gyorsítótárból jön elő, és ugyanaz szolgálja ki a feliratkészítőnket is.
Milyen fájlokat fogad el?
Gyakorlatilag bármit, amiben hang van: m4a, mp3, wav, ogg, opus, webm, aac, amr, és videófájlokat is. Ha a böngésző nem tudja megnyitni a fájlt, attól még megpróbáljuk — a hosszt ilyenkor a kinyert hangból számoljuk ki.
Mi a különbség a feliratkészítőhöz képest?
Ugyanaz a beszédfelismerés fut mindkettőben. A feliratkészítő időzített feliratsorokat ad SRT-ben és VTT-ben, videóhoz. Ez az oldal bekezdéseket ad időbélyeg nélkül, jegyzetnek.