Транскрибация аудио в текст — это перевод устной речи из записи в обычный текст. Раньше час интервью расшифровывали три-четыре часа руками, теперь нейросеть делает то же самое за минуты: загружаешь файл — получаешь готовый текст. В этом гайде разберём весь процесс по шагам: как сделать транскрибацию аудио и видео онлайн, какие форматы подходят, как расшифровывать интервью, лекции и рабочие встречи, что делать с тайм-кодами и спикерами и как из расшифровки за минуту получить саммари.
Это процессный гайд: идём от загрузки файла до готового протокола. Если нужен обзор рынка и сравнение инструментов — смотри подборку AI-сервисов для транскрибации.
Как сделать транскрибацию аудио в текст: 3 шага
В GPTunneL для этого есть отдельный инструмент — «Перевод аудио и видео в текст» на моделях Whisper от OpenAI. Устанавливать программу не нужно, всё происходит в браузере:
- Войди в GPTunneL. Регистрация по почте занимает минуту, один аккаунт даёт доступ ко всем инструментам платформы.
- Загрузи файл и выбери модель. Подойдёт аудио или видео — конвертировать ничего не нужно. Перед запуском интерфейс показывает стоимость обработки, она считается по длительности записи.
- Забери текст. Расшифровка сгруппирована по репликам — её можно скопировать или сохранить в .txt и .docx.

Моделей три: Whisper-Tiny — самая быстрая и дешёвая, для черновых расшифровок; Medium — баланс скорости и точности; Large — максимальная точность и ручной выбор языка. Для интервью, переговоров и всего, где важна каждая формулировка, бери Large.
Какие файлы подходят: форматы аудио и видео
Whisper принимает почти всё, что встречается в работе:
- аудио — MP3, WAV, OGG/OGA, FLAC, M4A;
- видео — MP4, WEBM, OGV, MOV (из видео нейросеть сама извлекает аудиодорожку).
На практике это значит, что транскрибация аудио и видео в текст работает с записями Zoom и Google Meet, вебинарами, подкастами, голосовыми сообщениями, обучающими роликами и архивными записями — без предварительной конвертации. Отдельная программа для транскрибации не нужна: всё делается онлайн, результат приходит через 10–60 секунд в зависимости от длины записи.
Один практический совет для очень тяжёлых файлов: если видео весит гигабайты, вытащи из него аудиодорожку в MP3 — загрузка пройдёт в разы быстрее, а качество расшифровки не изменится, ведь модель всё равно работает только со звуком.
Как транскрибировать интервью, лекцию или встречу
Сценарий определяет, какую модель выбрать и что делать с текстом после.
Интервью
Здесь критична точность цитат: «виденье», распознанное как «ведение», меняет смысл. Бери Whisper-Large и, если собеседник говорит не по-русски, выбирай язык вручную — автоопределение иногда ошибается даже на чёткой дикции. Готовая расшифровка сгруппирована по репликам, поэтому диалог читается как диалог, а не сплошное полотно.
Лекция или вебинар
Длинный монолог с терминами Whisper переносит хорошо — модель обучена примерно на 680 000 часов аудио с разными акцентами и шумом. После расшифровки удобно сразу попросить чат-модель составить конспект: тезисы, определения, список источников — из полутора часов лекции получается страница структурированных заметок.
Рабочая встреча или созвон
Самый частый бизнес-сценарий: запись созвона превращается в текст, текст — в протокол с решениями и задачами. Учитывай, что перебивания и одновременная речь снижают точность любой ASR-модели, поэтому запись с нормальным микрофоном расшифруется заметно лучше, чем звук с телефона на столе переговорки.
Длинные записи, тайм-коды и спикеры
Длинные файлы. Запись загружается целиком, стоимость считается по длительности и видна до запуска — сюрпризов не будет. Двухчасовой вебинар не нужно резать на куски вручную: Whisper сам сегментирует аудио на фрагменты по 30 секунд и собирает из них связный текст.
Тайм-коды. Модели Whisper размечают запись по временным сегментам — на этом строятся субтитры. Если расшифровка нужна с тайм-кодами под субтитры или монтаж, попроси чат-модель оформить готовый текст в нужный формат разметки.
Спикеры. Сам Whisper не различает голоса — он фиксирует речь, а текст группируется по репликам. Разметить участников по ролям проще вторым шагом: загрузи расшифровку в чат и попроси «размечай реплики: интервьюер / гость» — по контексту вопросов и ответов модель справляется с этим хорошо.
От чего зависит качество расшифровки
Точность ASR-систем измеряют метрикой WER (Word Error Rate) — долей ошибочных слов относительно эталонной расшифровки. Правило простое: чем крупнее модель, тем ниже WER. На практике качество зависит от четырёх вещей:
- Модель. В наших тестах Tiny путал словоформы и «достраивал» фразы по созвучию, а Large расшифровал то же стихотворение почти без ошибок — и быстрее.
- Язык. Автоопределение может промахнуться: Medium в тесте выдал испанский текст на русскую запись. У Large язык выбирается вручную — для иностранной речи это обязательный шаг.
- Запись. Шум, слабый микрофон и перебивания напрямую повышают процент ошибок. Числа — отдельная зона риска: «15 000» может превратиться в «15 1000», проверяй цифры по записи.
- Ожидания. Whisper фиксирует речь буквально: с паузами, оговорками и повторами. Он не редактирует стиль и не сокращает — это работа следующего шага.
Что делать с текстом после: саммари, протокол, статья
Расшифровка — это сырьё. Ценность появляется на втором шаге, когда текст превращается в рабочий документ. Открой чат в GPTunneL, вставь расшифровку и попроси:
- «Сделай саммари встречи: решения, задачи, ответственные, дедлайны» — готовый протокол;
- «Выбери 5 самых сильных цитат для анонса» — заготовка поста из интервью;
- «Преврати лекцию в конспект с определениями терминов» — учебные заметки;
- «Напиши статью по этой расшифровке, структура: проблема — решение — выводы» — черновик публикации.
Для таких задач хорошо подходит Gemini 3.6 Flash: контекст в 1 млн токенов вмещает расшифровку многочасовой записи целиком, а на вход модель принимает в том числе аудио — короткое голосовое можно разобрать прямо в чате, без отдельного инструмента.
Сколько стоит транскрибация аудио в текст
В GPTunneL транскрибация стоит от 1 ₽ за минуту аудио или видео: Whisper-Tiny — 1 ₽/мин, Medium — 1,25 ₽/мин, Large — 1,45 ₽/мин. Итоговая сумма считается по длительности записи и видна в интерфейсе до запуска: часовой созвон в Tiny — около 60 ₽. Подписки нет — платишь только за выполненные расшифровки с общего баланса платформы. Актуальные цены всех моделей — на странице цен.
Частые вопросы
Можно ли сделать транскрибацию аудио в текст бесплатно? Бесплатного тарифа в GPTunneL нет, но нет и подписки: расшифровка стоит от 1 ₽ за минуту записи, платишь за конкретный файл, а стоимость видишь до запуска. Для разовых задач это дешевле, чем месячная подписка на отдельный сервис.
Нужно ли скачивать программу для транскрибации? Нет. Всё работает онлайн в браузере: загрузил файл — получил текст. Ничего устанавливать и настраивать не нужно.
Распознаёт ли нейросеть русский язык? Да. Whisper обучен на многоязычном аудио и уверенно работает с русской речью, включая профессиональную терминологию. Для иностранных записей надёжнее выбрать язык вручную в Whisper-Large.
Можно ли транскрибировать видео? Да. Загружай MP4, WEBM, OGV или MOV — нейросеть сама извлечёт аудиодорожку и расшифрует её так же, как обычное аудио.
Как получить саммари встречи после транскрибации? Вставь готовую расшифровку в чат GPTunneL и попроси протокол: решения, задачи, дедлайны. С длинными записями удобнее работать в модели с большим контекстом — например, Gemini 3.6 Flash.
Какая модель Whisper точнее? Large: у неё самый низкий WER в линейке, она справляется со сложной лексикой и позволяет выбрать язык вручную. Tiny и Medium быстрее и дешевле — для черновиков этого достаточно.
Попробуй на своей записи
Возьми последний созвон или голосовое и загрузи в «Перевод аудио и видео в текст» — через минуту получишь текст, ещё через минуту чат превратит его в протокол или конспект. Без VPN, оплата картами российских банков в рублях, от 1 ₽ за минуту записи. Подробнее об инструменте — на его странице.



