Audio i wideo na tekst i podsumowanie — automatyczna transkrypcja mowy, wyodrębnianie kluczowych punktów i oczyszczanie mowy

📂

Lub wybierz dowolny plik audio / wideo (OGG, MP3, WAV, FLAC, M4A, MP4, WebM)

Wykład, spotkanie lub nagranie głosu są przetwarzane bezpośrednio na Twoim urządzeniu.

Pierwsza transkrypcja pobiera raz wybrany model offline Whisper, a następnie jest buforowana. Twój plik nigdy nie opuszcza Twojego urządzenia.

📖 Słownictwo określonych terminów i nazw (opcjonalnie)

Bez tego rzadkie nazwiska, tytuły i terminy zawodowe są rozpoznawane jako podobne słowa potoczne: imię kolegi rozbija się na dwa pospolite słowa, marka zamienia się w przypadkowy rzeczownik, termin wykładowy w znajomy nonsens. Wypisz tutaj takie słowa, oddzielone przecinkami, a model będzie je dokładniej rozpoznawał. Pozostała część przemówienia pozostaje niezmieniona: nic nie jest odrzucane ani zmuszane do dopasowania do listy.

Szybki zestaw:

20–30 słów działa lepiej niż długa lista: model czyta tylko początek podpowiedzi i pomija resztę.

Wszystko działa lokalnie — Twoje pliki nigdy nie opuszczają komputera Znalazłeś błąd lub masz pomysł? [email protected]