← Контент-завод · день 3/14 · кодовое слово АВТОМАТ

Озвучка, сабы и картинки - на автомате

Голос есть, лицо есть. Дальше самое муторное - каждый ролик я собирал руками: переозвучивал, подгонял субтитры по секундам, искал картинки-вставки. В третий день я превратил это в три станка, которые работают сами. Ниже - что это за инструменты и как их связать.

Развилка сразу: три отдельных станка

СтанокИнструментДеньги
Озвучкаклон голоса ElevenLabs + маленький свой скрипт склейкипо подписке ElevenLabs (голос из дня 1, слово КЛОН); скрипт бесплатный
Сабырасшифровщик faster-whisper (опенсорс)0 рублей - работает у вас на компьютере, локально
Картинкиkie (kie.ai), модель nano-bananaкарту России берёт, кадр стоит копейки (несколько рублей)

Станок 1. Озвучка одной командой

Раньше на озвучку уходил весь вечер: переделал голос, а потом руками сдвигай тайминги всех сцен под новую длину. Теперь это одна команда. Маленький скрипт делает по порядку:

Правка текста = перезапуск одной команды, тайминги пересчитываются сами. Никакой ручной подгонки.

Тонкость про клон: он иногда промахивается ударением. Лечится прямо в тексте - ставите ударение на нужную букву («стано́к», «сло́ва») и держите словарик выверенных слов, чтобы один и тот же ляп не ловить дважды.

Станок 2. Субтитры по каждому слову - бесплатно

Это мой любимый. Раньше субтитры я подгонял на глаз в файле: прикинул секунды, послушал, подвинул, пересобрал. Теперь работает faster-whisper - бесплатный расшифровщик, который крутится прямо на компьютере, без интернета и без оплаты.

Он слушает готовый звук и отдаёт тайминг каждого слова: с какой секунды по какую оно звучит. Из этого субтитры-караоке собираются сами, слово подсвечивается ровно тогда, когда его произносят. В прошлой серии он разметил так 104 слова - руками я бы возился час.

Расшифровщик иногда мажет на быстрых словах. Поэтому текст субтитров я беру из своего сценария, а от расшифровщика - только тайминги. Слово в кадре всегда правильное.

Станок 3. Картинки по описанию за копейки

Раньше кадры-вставки я искал и собирал поштучно. Теперь пишу словами - например «тетрадь в клетку, лампа, скрепка» - и нейросеть рисует готовый кадр. Пользуюсь kie (модель nano-banana): она принимает карту России, а кадр стоит копейки и готов за минуту.

Удобно, что можно дать ей своё фото как образец и попросить «то же лицо, но другой ракурс» - так собираются кадры в едином стиле.

Честно про грабли. Клон-голос - не идеал: ударения и быстрые слова приходится контролировать (перегенерить кусок или заменить слово). Расшифровщик изредка не слышит слово - страхуюсь своим текстом. Картинка не всегда выходит с первого раза - иногда 2-3 попытки. Но всё это - минуты, а не вечера.

Как это связано

Три станка стоят на одних рельсах: озвучка отдаёт звук и таймлайн → расшифровщик по звуку делает субтитры → картинки встают по таймлайну. Завтра (день 4) я соединяю их в одну кнопку - и спойлер: первый ролик, который система собрала сама, вышел ужасным. Но станки уже работают.

Кстати, эту страницу тоже собрал не руками с нуля, а своим помощником в Claude Code - по одному шаблону печатаются все гайды завода. Это и отличает завод от «купите мой курс».

Что дальше

Все гайды завода - на главной странице, по одному за серию. Следующий - день 4: система собирает первый ролик сама.