← Контент-завод · день 3/14 · кодовое слово АВТОМАТ
Голос есть, лицо есть. Дальше самое муторное - каждый ролик я собирал руками: переозвучивал, подгонял субтитры по секундам, искал картинки-вставки. В третий день я превратил это в три станка, которые работают сами. Ниже - что это за инструменты и как их связать.
| Станок | Инструмент | Деньги |
|---|---|---|
| Озвучка | клон голоса ElevenLabs + маленький свой скрипт склейки | по подписке ElevenLabs (голос из дня 1, слово КЛОН); скрипт бесплатный |
| Сабы | расшифровщик faster-whisper (опенсорс) | 0 рублей - работает у вас на компьютере, локально |
| Картинки | kie (kie.ai), модель nano-banana | карту России берёт, кадр стоит копейки (несколько рублей) |
Раньше на озвучку уходил весь вечер: переделал голос, а потом руками сдвигай тайминги всех сцен под новую длину. Теперь это одна команда. Маленький скрипт делает по порядку:
Правка текста = перезапуск одной команды, тайминги пересчитываются сами. Никакой ручной подгонки.
Тонкость про клон: он иногда промахивается ударением. Лечится прямо в тексте - ставите ударение на нужную букву («стано́к», «сло́ва») и держите словарик выверенных слов, чтобы один и тот же ляп не ловить дважды.
Это мой любимый. Раньше субтитры я подгонял на глаз в файле: прикинул секунды, послушал, подвинул, пересобрал. Теперь работает faster-whisper - бесплатный расшифровщик, который крутится прямо на компьютере, без интернета и без оплаты.
Он слушает готовый звук и отдаёт тайминг каждого слова: с какой секунды по какую оно звучит. Из этого субтитры-караоке собираются сами, слово подсвечивается ровно тогда, когда его произносят. В прошлой серии он разметил так 104 слова - руками я бы возился час.
Расшифровщик иногда мажет на быстрых словах. Поэтому текст субтитров я беру из своего сценария, а от расшифровщика - только тайминги. Слово в кадре всегда правильное.
Раньше кадры-вставки я искал и собирал поштучно. Теперь пишу словами - например «тетрадь в клетку, лампа, скрепка» - и нейросеть рисует готовый кадр. Пользуюсь kie (модель nano-banana): она принимает карту России, а кадр стоит копейки и готов за минуту.
Удобно, что можно дать ей своё фото как образец и попросить «то же лицо, но другой ракурс» - так собираются кадры в едином стиле.
Три станка стоят на одних рельсах: озвучка отдаёт звук и таймлайн → расшифровщик по звуку делает субтитры → картинки встают по таймлайну. Завтра (день 4) я соединяю их в одну кнопку - и спойлер: первый ролик, который система собрала сама, вышел ужасным. Но станки уже работают.
Кстати, эту страницу тоже собрал не руками с нуля, а своим помощником в Claude Code - по одному шаблону печатаются все гайды завода. Это и отличает завод от «купите мой курс».
Все гайды завода - на главной странице, по одному за серию. Следующий - день 4: система собирает первый ролик сама.