Media Processing

Розшифровка аудіо й відео в текст

Подкасти, інтерв'ю, голосові повідомлення, лекції та зустрічі — завантажте запис і отримайте текст, із таймкодами, коли вони потрібні.

Перетягніть файл сюдиабо натисніть, щоб обрати, — він відкриється в студії з цим інструментом. Для невеликих файлів акаунт не потрібен.Обрати файл

Як це працює

  1. 1Завантажте аудіо або відео — MP3, WAV, M4A, OGG, FLAC, MP4, MOV та інші.
  2. 2Оберіть результат: текст, субтитри (SRT, VTT) або JSON із таймінгами.
  3. 3Скачайте розшифровку.

Що ви отримуєте

Аудіо й відео

Голосові, подкасти й записи дзвінків завантажуються як є — не треба спершу робити з них відео.

Таймкоди кожного слова

JSON містить початок і кінець кожного слова — для пошуку, підсвічування або власного редактора.

Ваші імена й терміни

Через API передайте список назв продуктів, імен і жаргону — і розпізнавання писатиме їх так, як пишете ви.

Кілька форматів за раз

Замовте текст, SRT і VTT одним запитом і отримайте їх разом в одному архіві.

Те саме через API

Один заголовок, один multipart-запит із файлом, далі опитуєте задачу або отримуєте вебхук. Та сама операція, яку ви щойно спробували в браузері.

Документація API · Quickstart

Питання

Наскільки це точно?

Використовується OpenAI Whisper. Чітке мовлення поширеною мовою розпізнається дуже добре; явно вказана мова допомагає з акцентами й короткими кліпами.

Чи можна одразу перекласти?

Так, англійською: оберіть «Переклад → англійська» як мову результату.

Що буде, якщо мовлення немає?

Ви отримаєте порожню розшифровку, а не помилку — зручно, коли обробляєте багато файлів автоматично.

Чи можна надсилати файли з власного застосунку?

Так. API транскрипції приймає файл одним запитом і повертає задачу, яку ви опитуєте, або викликає ваш вебхук після завершення.