Poros nepilnamečių, turinčių didelę AI kompetenciją, sako, kad jie sukūrė atvirai prieinamą AI modelį, kuris gali generuoti podcast’o stiliaus klipus, panašius į „Google“ nešiojamąją knygą.

Sintetinių kalbų įrankių rinka yra didžiulė ir auga. „EleveenLabs“ yra vienas didžiausių žaidėjų, tačiau iššūkių trūksta (žr. „Playai“, „Sesame“ ir pan.). Investuotojai mano, kad šios priemonės turi didžiulį potencialą. Anot „PitchBook“, pradedantiesiems „Voice AI Tech“, praėjusiais metais, „Voice AI Tech“ surinko daugiau nei 398 mln. USD.

Toby Kim, vienas iš Korėjoje įsikūrusio „Nari Labs“ įkūrėjų, naujai išleisto modelio grupė, teigė, kad jis ir jo kolega įkūrėjas prieš tris mėnesius pradėjo mokytis apie kalbą apie kalbą. Įkvėpti „NoteBookLM“, jie norėjo sukurti modelį, kuris pasiūlytų daugiau kontroliuoti sugeneruotus balsus ir „laisvę scenarijuje“.

Kim sako, kad jie naudojo „Google“ TPU tyrimų debesų programą, kuri tyrėjams suteikia nemokamą prieigą prie bendrovės TPU AI lustų, kad išmokytų „Nari“ modelį, DIA. Sveriant 1,6 milijardo parametrų, DIA gali generuoti dialogą iš scenarijaus, leisdamas vartotojams pritaikyti garsiakalbių tonus ir įterpti nepatogumų, kosulių, juokų ir kitų neverbalinių užuominų.

Parametrai yra vidiniai kintamųjų modeliai, naudojami prognozėms padaryti. Paprastai modeliai su daugiau parametrų veikia geriau.

Galima įsigyti iš „Ai Dev“ platformos, apkabinančios veidą ir „Github“, „Dia“ gali veikti daugelyje modernių kompiuterių, turinčių bent 10 GB VRAM. Tai sukuria atsitiktinį balsą, nebent būtų paskatintas aprašyti numatytą stilių, tačiau jis taip pat gali klonuoti žmogaus balsą.

Trumpame „TechCrunch“ bandyme „Dia“ per „Nari“ žiniatinklio demonstracinę versiją DIA veikė gana gerai, nesutvarkydama dvipusių pokalbių bet kokiu dalyku. Atrodo, kad balsų kokybė yra konkurencinga su kitomis priemonėmis, o balso klonavimo funkcija yra viena lengviausia, kurią išbandė šis žurnalistas.

Štai pavyzdys:

Kaip ir daugelis balso generatorių, „Dia“ mažai siūlo apsaugos priemones. Būtų trivialiai lengva sukurti dezinformaciją ar sukčiavimo įrašą. DIA projekto puslapiuose Nari atgraso piktnaudžiauti modeliu, kad apsimestų, apgaudinėtų ar kitaip įsitrauktų į neteisėtas kampanijas, tačiau grupė sako, kad ji „neatsako“ už netinkamą naudojimą.

„Nari“ taip pat neatskleidė, kuriuos duomenis jis nutraukė, kad būtų galima treniruotis DIA. Gali būti, kad DIA buvo sukurta naudojant autorių teisių saugomą turinį – „Hacker News“ komentatorius pažymi, kad vienas pavyzdys skamba kaip NPR „Planet Money“ podcast’o šeimininkai. Autorių teisių saugomo turinio mokymo modeliai yra plačiai paplitusi, bet teisiškai abejotina praktika. Kai kurios AI bendrovės teigia, kad sąžiningas naudojimas juos apsaugo nuo atsakomybės, o teisių turėtojai tvirtina, kad sąžiningas naudojimas netaikomas mokymui.

Bet kokiu atveju Kim sako, kad Nari planas yra sukurti sintetinę balso platformą su „socialiniu aspektu“ ant DIA ir didesnių, ateities modelių. „Nari“ taip pat ketina išleisti DIA techninę ataskaitą ir išplėsti modelio palaikymą kalbomis, ne tik anglų kalba.



Source link