Media Processing

Zamień audio i wideo na tekst

Podcasty, wywiady, wiadomości głosowe, wykłady i spotkania — wgraj nagranie i odbierz tekst, w razie potrzeby ze znacznikami czasu.

Interfejs studia jest dostępny po angielsku, ukraińsku i rosyjsku.

Upuść plik tutajalbo kliknij i wybierz — otworzy się w studiu z tym narzędziem. Małe pliki nie wymagają konta.Wybierz plik

Jak to działa

  1. 1Wgraj plik audio lub wideo — MP3, WAV, M4A, OGG, FLAC, MP4, MOV i inne.
  2. 2Wybierz wynik: czysty tekst, napisy (SRT, VTT) albo JSON z czasami.
  3. 3Pobierz transkrypcję.

Co otrzymujesz

Audio i wideo

Wiadomości głosowe, podcasty i nagrania z telefonu trafiają tak, jak są — bez wcześniejszej zamiany na wideo.

Znaczniki czasu dla słów

Wynik JSON zawiera początek i koniec każdego słowa, gotowe do wyszukiwania, podświetlania lub własnego edytora.

Twoje nazwy i terminy

Przez API przekażesz listę nazw produktów, osób i żargonu, żeby rozpoznawanie zapisywało je tak jak ty.

Kilka formatów naraz

Poproś o tekst, SRT i VTT w jednym żądaniu i odbierz je razem w jednym archiwum.

To samo przez API

Jeden nagłówek, jedno żądanie multipart z plikiem, potem odpytujesz zadanie albo odbierasz webhook. Ta sama operacja, którą przed chwilą wypróbowałeś w przeglądarce.

Dokumentacja API · Quickstart

Pytania

Jak dokładne to jest?

Używa OpenAI Whisper. Wyraźna mowa w popularnym języku jest transkrybowana bardzo dobrze; jawne ustawienie języka pomaga przy akcentach i krótkich klipach.

Czy może tłumaczyć podczas transkrypcji?

Tak, na angielski: wybierz „Translate → English” jako język wyniku.

Co jeśli w nagraniu nie ma mowy?

Dostajesz pustą transkrypcję, a nie błąd — przydatne przy automatycznym przetwarzaniu wielu plików.

Czy mogę wysyłać pliki z własnej aplikacji?

Tak. API transkrypcji przyjmuje plik w jednym żądaniu i zwraca zadanie do odpytywania albo wywołuje twój webhook po zakończeniu.