Тебе нужна расшифровка чужого интервью или Reels — чтобы вытащить цитату, собрать субтитры или нарезать ролик на клипы. У YouTube субтитры вроде бы есть, но под видео их не видно и не скачать, а у Reels и TikTok текста нет вовсе: только звук и твои уши. Сначала разберёмся, что вообще можно забрать на выходе, потом — как получить текст из видео на каждой площадке и как проверить, что расшифровка не врёт.
Коротко
- Расшифровка бывает трёх видов: сплошной текст абзацами, субтитры с таймингами и таймкоды для глав.
- YouTube сам генерирует авто-субтитры — их можно забрать; если их нет или они кривые, звук распознают заново.
- Reels и TikTok готовый текст не отдают: только распознавание звука. Прямая ссылка на Reels иногда не отдаётся — есть фолбек через источник Instagram, но и он не всесилен.
- Под цитаты и посты бери TXT, под субтитры и нарезку — SRT или VTT, под описание длинного ролика — таймкоды.
- В Kutto распознавание своей моделью — 0 ₽, без доплаты с баланса: платит только облачное звено и только из ИИ-объёма тарифа.
Что в итоге получится — и какой формат нужен тебе?
На выходе у расшифровки не один, а три вида записи, и выбирать надо под задачу, а не «чтобы было». Сплошной текст абзацами нужен для цитат, поста, описания, черновика статьи — там время неважно. Субтитры с таймингами — для того, что поедет в плеер, в монтаж или на площадку: каждая реплика знает, когда началась и когда закончилась.
Третий вид — таймкоды для глав. Это тот же текст, только с отметками вроде 00:00, 04:12, 11:38, которые можно вставить в описание длинного ролика, чтобы зритель прыгал по смысловым кускам. Полезно, когда расшифровка уже есть, а ролик длинный и его надо разложить на отрезки для описания или нарезки.
Дальше всё зависит от площадки: где-то текст лежит готовым и его достаточно забрать, где-то его придётся распознавать из звука. Об этом — следующий раздел.
Почему у YouTube текст есть, а у Reels и TikTok — нет?
YouTube генерирует авто-субтитры на своей стороне: распознаёт звук и хранит результат у себя, поэтому под роликом появляется кнопка «Субтитры», а в студии автора — дорожка текста. Их можно забрать, если автор их не отключил и если площадка успела их сгенерировать. Бывает и так, что субтитров нет: ролик свежий, язык распознавания не поддерживается или автор просто не дал тексту появиться.
У Reels и TikTok такой готовой дорожки нет. Площадки показывают субтитры поверх видео, но расшифровку не отдают: это часть плеера, не файл. Значит, любой текст из чужого ролика там приходится получать самому — скачать звук и распознать его заново. То же правило работает и для чужого YouTube-ролика, где субтитры отключены.
Разница принципиальная: авто-субтитры площадки — чужой инструмент, ты не влияешь ни на язык, ни на разбивку, ни на аккуратность. Своё распознавание — твой результат, его можно перепроверить, поправить и забрать в нужном формате. Ниже — как это выглядит по площадкам.
| Площадка | Готовый текст от площадки | Что обычно делают | Что забираешь на выходе |
|---|---|---|---|
| YouTube | Авто-субтитры, если автор их не отключил | Скачивают готовую дорожку или распознают звук заново | TXT, SRT, VTT, таймкоды |
| Shorts | Обычно та же дорожка, что у длинного видео | Скачивают дорожку или распознают звук | TXT, SRT, VTT |
| Reels | Нет | Скачивают звук по ссылке и распознают | TXT, SRT, VTT |
| TikTok | Нет | Скачивают звук по ссылке и распознают | TXT, SRT, VTT |
| VK | Нет | Скачивают звук по ссылке и распознают | TXT, SRT, VTT |
| Свой файл | Зависит от исходника | Распознают звук из файла | TXT, SRT, VTT |
Как вытащить текст из видео на YouTube?
Порядок простой: сначала смотри, есть ли готовые субтитры, и только потом, если их нет или они читаются как каша, распознавай звук заново. Так не тратишь время на повторную работу, которая уже сделана площадкой.
- 1
Скопируй ссылку на ролик
Скопируй адрес видео из браузера или приложения. Ссылки youtu.be/X и watch?v=X&t=90 — один и тот же ролик, распознавание это учитывает и не станет делать работу дважды.
- 2
Вставь её в поле транскрипта
Открой инструмент и вставь ссылку. Профиль или канал вместо ролика поле отобьёт: расшифровки канала не бывает, только конкретного видео. Файл из медиатеки тоже принимается — видео или аудио не длиннее часа.
- 3
Посмотри, что нашлось под видео
Если у ролика есть готовая дорожка субтитров, текст появится быстро и почти без ошибок. Если дорожки нет, включится распознавание звука — от собственной модели до облачной, если своя не справилась.
- 4
Забери текст в нужном виде
На экране — текст абзацами, рядом скачивание SRT и VTT и кнопки перехода: отправить текст в сценарий или ссылку в нарезку на клипы. Абзацы собираются через пустую строку, поэтому текст сразу читается, а не лежит полотном.
- 5
Проверь стык на паузе
Пролистай до места, где спикер сделал вдох или сменил тему. Реплика должна закрываться на паузе, а не посреди слова — если всё рвётся, текст можно распознать заново.

Отдельно стоит сказать про разбивку. Реплики режутся не по кускам распознавания, а по словам: фраза закрывается на конце предложения, на паузе от 0,8 с, на 84 знаках — это две строки по 42, потолок гайда субтитров Netflix — и на шести секундах. Иначе из получасового разговора выходили бы реплики по полстроки экрана, которые в плеере мигают и не читаются.
Как получить текст из Reels и TikTok?
Тут готовой дорожки нет, поэтому путь один: достать звук и распознать. Ссылка на ролик подходит и для вертикальных записей, и для обычных видео — тип ссылки определится сам. Если ролик записан не с нуля, а вырезан из длинного, распознавание всё равно даст текст только этого куска: тайминги считаются от начала ролика, а не от начала исходника.
С Reels бывает отдельная история: прямая ссылка иногда не отдаётся, и тогда забор идёт через фолбек по источнику Instagram. Это работает не всегда — приватный аккаунт или изменившаяся разметка страницы могут сломать забор. Если ролик не тянется, скачай его через официальную выгрузку или приложение и распознай из файла: результат тот же, только исходник ты приносишь руками.
- 1
Скопируй ссылку на Reels или TikTok
Подойдёт обычная публичная ссылка без сокращений и редиректов. Если ссылка ведёт на профиль, а не на ролик, поле её отобьёт.
- 2
Вставь ссылку и запусти распознавание
Забор звука идёт своим способом для каждой площадки, а дальше — та же цепочка распознавания, что и для YouTube. Текст появится абзацами, тайминги будут считаться от начала ролика.
- 3
Если ссылка не отдалась — неси файл
Скачай ролик и загрузи его в медиатеку. Принимается видео или аудио до часа: из файла звук вынимается в моно 16 кГц — этого хватает для распознавания речи.
- 4
Забери текст и реши, что дальше
Из текста собираются субтитры для того же ролика, цитата для подписи или нарезка на клипы — вертикальная запись уже готова к тому, чтобы резаться по речи.
Именно для этого случая в Kutto есть инструмент, который берёт ссылку с любой из площадок — YouTube, Shorts, Reels, TikTok, VK — и возвращает текст абзацами, SRT и VTT. Дальше эти же тайминги работают входом для хуков, субтитров и клипов.
Что внутри TXT, SRT и VTT и чем они отличаются?
Все три формата несут один и тот же текст, разница только в том, что к нему приложено. TXT — это абзацы через пустую строку: чистый материал под цитату, пост, статью, черновик сценария. Времени там нет вообще, поэтому для субтитров он не годится.
SRT — стандарт субтитров: номер реплики, время начала и конца, строка текста, пустая строка, следующая реплика. Его понимают монтажки, плееры, редакторы субтитров и большинство площадок. VTT — родственник SRT из мира веба: та же структура, но со своей шапкой и настройками, поэтому его удобнее подключать к плееру на сайте или в приложении.
| Формат | Что внутри | Тайминги | Куда идёт |
|---|---|---|---|
| TXT | Текст абзацами через пустую строку | Нет | Цитата, пост, статья, черновик сценария |
| SRT | Нумерованные реплики: время начала и конца, две строки текста | Есть, по репликам | Монтаж, редакторы субтитров, площадки |
| VTT | Реплики с шапкой и веб-метками | Есть, по репликам | Плеер на сайте, приложение, веб-плееры |
| Таймкоды | Отметки вида 00:00 с началом фразы | Есть, укрупнённо | Описание длинного ролика, главы |
Реплики внутри SRT и VTT режутся по словам, а не по сегментам распознавания: сегмент бывает длиной в полминуты, и одной такой репликой субтитр не читается. Поэтому фраза закрывается по концу предложения, по паузе, по длине строки и по шести секундам максимум. Две строки делятся ближе к середине, с форой переносу после знака препинания — иначе во второй строке остаётся одно слово. Перекрывающиеся реплики подрезаются: иначе плеер показывает два субтитра сразу и текст прыгает.
Сколько это стоит и сколько ждать?
Распознавание идёт на своей модели и денег не стоит: в Kutto транскрипт — 0 ₽, без доплаты с баланса. Если своя модель не осилила ролик, включается облачное звено, и оно уже уходит в ИИ-объём тарифа как «Тексты ИИ». Отдельной строки в прайсе у транскрипта нет — платить штуками за него не нужно.
По времени всё зависит от длины ролика и от того, откуда берётся звук. Короткий клип распознаётся заметно быстрее, чем интервью на час; скачивание исходника по ссылке — отдельный шаг, который тоже занимает своё. Точных секунд на минуту записи назвать нельзя: это зависит от очереди и от того, какая модель взяла задачу.
Повтор дешевле первого раза. Расшифровка хранится по ключу ролика, поэтому повторный запуск для той же ссылки отдаётся из кэша и заново ничего не считает. Для файла ключом служит сам файл: тот же ассет — тот же текст. Упавшая задача в кэш не попадает, её можно распознать заново. Результат расшифровки — это ещё и заготовка: из него собираются субтитры, хуки по первым фразам, таймкоды для описания и нарезка на клипы.
Как проверить расшифровку на своём ролике за минуту?
Быстрая проверка без всяких замеров точности: возьми кусок ролика с самой быстрой речью — первые тридцать секунд, где спикер частит, делает вдохи и перескакивает с темы на тему. Прогони его отдельно и прочитай текст вслух рядом с плеером. Смотри не на опечатки, а на стыки фраз: реплика должна закрываться на паузе, а не посередине слова.
Дальше три вещи, которые ломаются чаще всего. Имена собственные и названия — проверь по ролику, а не по памяти. Числа и даты — распознавание регулярно слышит «пятнадцать» там, где было «пятьдесят». Обрывки в самом начале и в конце, где спикер говорит поверх музыки: это первые кандидаты на правку.
- Сверь по ролику имена, бренды и термины — их распознавание коверкает чаще всего.
- Пролистай места, где два голоса накладываются: там перемешанные реплики.
- Проверь числа, даты и суммы: их надо слушать ушами, а не читать глазами.
- Проверь, что реплики не перекрывают друг друга — иначе в плеере субтитр прыгает.
Чек-лист перед тем как забрать текст
Перед выгрузкой пройди по четырём пунктам: они занимают минуту и ловят почти все проблемы, из-за которых расшифровку приходится переделывать позже.
- Формат выбран под задачу: TXT — под цитаты и посты, SRT или VTT — под субтитры и монтаж, таймкоды — под описание.
- Имена, термины и числа сверены с роликом, а не с памятью.
- Стыки реплик ровные: фразы закрываются на паузах, наложений нет.
- Понятно, куда текст идёт дальше: в сценарий как материал или в нарезку как клипы и субтитры.
Текст — это только половина дела. Из него обычно собирают то, что поедет на площадку: субтитры поверх ролика, клипы из длинной записи или главы для описания. Kutto берёт ссылку или файл и отдаёт расшифровку с пословными таймингами — достаточно, чтобы резать по речи, а не на глаз.
Транскрипт
Расшифровка, из которой собираются субтитры и клипы
Вставь ссылку или файл — получишь текст абзацами, SRT и VTT. Дальше можно сразу уйти в субтитры для того же ролика или в нарезку на вертикальные клипы.
Открыть ТранскриптЧастые вопросы
Как получить текст из видео на YouTube, если автор отключил субтитры?
Готовой дорожки у такого ролика нет, поэтому текст получают распознаванием звука. Вставь ссылку в инструмент — звук скачается, и текст соберётся с нуля: абзацами, с SRT и VTT.
Можно ли скачать субтитры с YouTube сразу в SRT?
Да, если у ролика есть дорожка субтитров: на выходе рядом с текстом лежат SRT и VTT. Оба файла собираются из одних и тех же реплик, отличаются форматом.
Как достать текст из Reels в Instagram?
По ссылке на ролик: звук забирается фолбеком через источник Instagram, дальше идёт распознавание. Прямая ссылка иногда не отдаётся — тогда скачай ролик и распознай из файла, принимается видео или аудио до часа.
Чем SRT отличается от VTT?
Структура почти одна: нумерованные реплики с началом и концом. У VTT есть своя шапка и веб-метки, поэтому его удобнее подключать к плееру на сайте, а SRT — стандарт для монтажа и площадок.
Бесплатно ли транскрибировать видео?
Распознавание своей моделью в Kutto стоит 0 ₽ и не тратит баланс. В ИИ-объём тарифа уходит только облачное звено — в Kutto это «Тексты ИИ».
Почему распознавание путает слова, когда играет музыка?
Голос и музыка попадают в один канал записи, и модели сложнее разделить их на слух: там, где речь перекрыта, текст начинает угадывать. Если дорожки развести заранее — вынуть голос без музыки и распознать отдельно, — ошибок обычно меньше.
Можно ли получить текст из видео по файлу, а не по ссылке?
Да. Загрузи видео или аудио в медиатеку и распознай его — из файла звук вынимается в моно 16 кГц. Тот же файл потом можно отправить в нарезку без повторной закачки.

