Бесплатная транскрипция аудио — речь в текст локально | nopa

Утилиты

Локальная транскрипция аудио

Загрузите аудио и получите текст для копирования или скачивания — модель речи может скачаться один раз и сохраниться на устройстве.

Попробуйте сразу — без аккаунта

Сохранить и продолжить на рабочем столе

Скачайте или скопируйте результат прямо здесь. В рабочем столе он сохранится в Файлы, а инструмент откроется в полной версии.

  • Транскрипция аудио в текст локально — без загрузки
  • Сохраните в Файлы, когда продолжите на рабочем столе
  • Все инструменты рядом — без новых вкладок
Открыть бесплатный рабочий стол

После скачивания — продолжите на рабочем столе: Файлы или полная версия.

Что умеет Транскрипция

Быстрая модель по умолчанию, точная — по запросу

Распознавание речи работает через Whisper прямо на вашем устройстве. По умолчанию используется компактная модель (40 МБ, а в браузерах с поддержкой GPU 150 МБ) — она быстро запускается даже на небольшом ноутбуке. Для сложной записи — шум, несколько голосов вперебивку, специальные термины — в полном приложении можно переключиться на модель покрупнее (около 75 МБ): точнее, но и медленнее. Обе модели работают только на устройстве, и расшифровка остаётся у вас.

Честные лимиты по размеру и длительности

На компьютере — файлы до 100 МБ и до 30 минут звучания, на телефоне — до 50 МБ и 10 минут. Разница не капризная: модель распознавания держится прямо в памяти браузера, а на телефоне этой памяти заметно меньше, чем на ноутбуке, — поэтому длинную запись лучше расшифровывать за компьютером.

Текст или файл с таймкодами

Готовую расшифровку можно скачать как обычный .txt или как .srt — субтитровый файл с таймкодом на каждый фрагмент, тот же, что вы видите на экране во время расшифровки. .txt подходит для протокола встречи или черновика статьи, .srt читают видеоплееры и сервисы субтитров.

Похожие приложения

Все AI-инструменты

Вопросы

Аудио куда-то отправляется?

Нет. Расшифровка идёт локально в браузере, когда это поддерживается. Модель распознавания может один раз скачаться из открытого хаба моделей и закешироваться на устройстве.

В чём разница между быстрой моделью и моделью «Качественнее»?

Быстрая (40 МБ, с GPU 150 МБ) справляется с чистой записью и запускается почти сразу; «Качественнее» (75 МБ, с GPU 290 МБ) точнее на шуме, нескольких голосах и специальных терминах, но и работает медленнее. Обе — полностью на устройстве.

Какие языки поддерживаются?

Многоязычная модель Whisper понимает английский, русский, испанский, немецкий, французский, португальский, итальянский, турецкий, индонезийский, украинский, польский, китайский, японский и корейский. Язык записи лучше указать: по умолчанию берётся язык браузера, а не определяется по звуку.

В каком формате скачать результат?

.txt для обычного текста или .srt с таймкодами по каждому фрагменту — подходит для субтитров и видеоплееров.

Будет работать с телефона?

Иногда, но лимиты там ниже — до 50 МБ и 10 минут вместо 100 МБ и 30 на компьютере, а модель может работать медленнее. Для длинной записи лучше открыть эту страницу на компьютере в Chrome или Edge.