Transkrypcja z rozróżnianiem głosów w czasie rzeczywistym. Co nowa cena API audio zmienia dla firm
Meta weszła na rynek transkrypcji audio w czasie rzeczywistym z modelem, który łączy w jednym potoku trzy rzeczy naraz: zamianę mowy na tekst, wykrywanie końca wypowiedzi i rozróżnianie głosów wielu uczestników. To ostatnie, czyli diaryzacja, obsługuje ponad 20 mówiących jednocześnie bez żadnego dodatkowego etapu po zakończeniu nagrania. Model przetrenowano na ponad 70 językach, z czego 25 dokładniej przetestowano. Cena publicznego API wynosi 18 centów za godzinę przetworzonego audio.
Jeszcze dwa, trzy lata temu diaryzacja na tej skali wymagała osobnego serwisu, osobnego budżetu i kilku minut oczekiwania na wynik po zakończeniu rozmowy. Teraz wszystko przychodzi w strumieniu, zanim nagranie dobiegnie końca. To zmiana jakościowa, nie tylko cenowa.
Co to oznacza dla polskich firm (sprzedaż, obsługa klienta, HR, operacje)
Obsługa klienta i call center to pierwsze miejsce, gdzie ta zmiana jest od razu widoczna. Automatyczna transkrypcja rozmowy z oznaczeniem, kto mówił w danym momencie, pozwala budować pełne logi bez ręcznego tagowania. Przy kilkudziesięciu konsultantach i setkach rozmów dziennie koszt 18 centów za godzinę przestaje być barierą i staje się pozycją w budżecie łatwą do uzasadnienia przełożonemu.
Spotkania wieloosobowe. Firma z komitetem sterującym, radą nadzorczą albo regularnymi warsztatami projektowymi dostaje protokół z podziałem na uczestników bez angażowania asystentki i bez transkrybowania z pamięci. 20 uczestników w jednym pliku to tyle, ile zmieści się w przeciętnym zebraniu zarządu z gośćmi zewnętrznymi.
HR zyskuje narzędzie do strukturyzowania rozmów rekrutacyjnych i ocen pracowniczych. Transkrypt z oznaczonymi głosami kandydata i rekrutera można potem przeszukiwać albo podawać do modelu analitycznego bez żmudnego redagowania. Czas zwrotu z wdrożenia jest tu krótki.
Kilka rzeczy warto sprawdzić przed uruchomieniem produkcyjnym. Po pierwsze, spośród 25 dokładniej przetestowanych języków trzeba upewnić się co do poziomu dokładności dla polskiego. Po drugie, dane głosowe klientów i pracowników podlegają RODO, więc architektura przesyłu dźwięku do zewnętrznego API wymaga oceny zgodności zanim ruszy produkcja. Po trzecie, inne platformy na rynku deklarują obsługę 50 czy nawet 100 uczestników, więc przy bardzo dużych wydarzeniach nadal warto porównać oferty.
Tam gdzie wcześniej transkrypcja audio była zadaniem dla specjalisty z odpowiednim oprogramowaniem, teraz jest usługą o cenie niższej niż jedna kawa za godzinę nagrania. To zmienia rachunek opłacalności dla każdej firmy, która ma dużo rozmów do przetworzenia i jeszcze nie zautomatyzowała ich archiwizacji.
Jeśli chcesz wiedzieć, czy ten rodzaj automatyzacji pasuje do waszych procesów i jak bezpiecznie połączyć go z istniejącymi systemami, zapraszamy na bezpłatny audyt.
Opracowanie: zespół redAi z wykorzystaniem narzędzi AI.
Więcej aktualności
- Modele rozumiejące obrazy i tekst razem stają się naprawdę szybkie. Co to zmienia dla firm
- Składki ZUS i NFZ na 2027 r. mają już szacunkowe kwoty. Co to zmienia w Płatnik ZUS
- KSeF bez sankcji przez kolejny rok i co to zmienia dla integracji z AI
- e-Doręczenia wymogiem prawnym przy zmianie danych w CEIDG – co to oznacza dla firm na ePUAP i e-Doręczenia