Видео

Claude видео: что он умеет и чем сделать ролик

12.09.2026 · обновлено 22.09.2026

Вокруг ролика Claude работает словами: пишет сценарий, раскладывает сцены по порядку, разбирает расшифровку и субтитры, собирает описание кадра для видеомодели. Сам видеофайл он на вход не берёт и готовый ролик не отдаёт — видео нет ни в одном перечне типов, которые Anthropic называет поддерживаемыми. Ниже разобрано, чем посмотреть запись целиком, как донести её содержимое до Claude, чем сделать сам ролик и сколько стоит секунда.


Claude видео: что он берёт на вход и что делает с роликом

Перечень моделей Anthropic описывает вход одинаково у всех текущих моделей: текст и изображение, на выходе текст. Таблица поддерживаемых типов в Files API содержит PDF, обычный текст, изображения и загрузку данных для инструмента исполнения кода. Справка о загрузке файлов на claude.ai перечисляет документы PDF, DOCX, CSV, TXT, HTML, ODT, RTF, EPUB, JSON и XLSX, а из изображений — JPEG, PNG, GIF и WebP. Там же названы пределы загрузки: до 500 МБ на файл и до 20 файлов на разговор, изображение до 8000×8000 точек, PDF до 1000 страниц.

Перечни поддерживаемых типов собраны из документов, изображений и текста. Звук и видео в них не названы: ни отдельная дорожка, ни запись разговора, ни видеофайл среди поддерживаемых типов не стоят. Для того, кто пришёл разобрать созвон или лекцию, это и есть главный ответ — содержимое записи доносят до Claude кадрами и расшифровкой.

Работы вокруг ролика при этом остаётся много, и вся она текстовая:

  • сценарий и план сцен с порядком и длительностью каждой;
  • разбор расшифровки и субтитров, которые приходят обычным текстом;
  • описание кадра, которое потом уходит видеомодели;
  • тексты к самому выпуску: заголовок, описание, подписи.

Дальше эти задачи расходятся на две. Посмотреть, что происходит в записи, может модель, у которой видео стоит на входе. Сделать ролик может видеомодель. Claude связывает оба шага словами: по разобранной записи пишет конспект, по замыслу — сценарий и описания кадров.

Чем посмотреть ролик целиком

Видео на входе есть у Gemini 3.6 Flash и Gemini 3.7 Flash: в каталоге GEN202 у обеих записей рядом с текстом и картинкой стоят звук и видео. Ролик им отдают как есть, без нарезки на кадры, и вместе с картинкой доходит дорожка — то есть и то, что показано, и то, что сказано.

Счёт у текстовых моделей идёт за токены, отдельно за вход и за выход. У Gemini 3.6 Flash миллион токенов входа стоит 173 ₽, миллион выхода — 865,5 ₽. У Gemini 3.7 Flash вход стоит 173 ₽, выход — 865,5 ₽.

Что закрывается этим шагом:

  • Конспект видеоурока. Модель получает запись и возвращает текст: о чём урок, в каком порядке идут темы, какие действия автор показывает на экране.
  • Разбор созвона. Звук на входе здесь важнее картинки: по записи встречи собирают пересказ, список решений и список задач с именами.
  • Расшифровка. Речь снимается с дорожки и возвращается обычным текстом, а такой текст Claude уже принимает как любой другой документ.

Дальше работа возвращается в Claude: конспект, расшифровка и список задач — это текст, и с ним он работает без ограничений по формату.

Где взять расшифровку и субтитры

Расшифровка — обычный текстовый файл, и формат .txt в списке загрузки Claude есть. Берут её одним из двух способов.

Первый — готовые субтитры. У видеоплощадок дорожка субтитров чаще всего собирается автоматически и скачивается отдельным файлом рядом с самим роликом. Такой текст приходит с ошибками распознавания: имена, названия и числа в нём страдают заметнее остального, поэтому перед разбором его стоит бегло прочитать и поправить хотя бы имена.

Второй — снять речь с записи моделью, которая принимает звук на входе. Те же Gemini 3.6 Flash и Gemini 3.7 Flash берут дорожку вместе с роликом и возвращают текст. Этот путь остаётся единственным, когда своя запись лежит файлом и никаких субтитров к ней нет.

Как показать Claude, что происходит в ролике

Когда работать нужно именно в Claude, запись разбирают на то, что он принимает: на кадры картинками и на речь текстом. Два входа хорошо складываются — расшифровка несёт всё сказанное, кадры показывают то, чего в речи нет.

Сколько кадров брать. Бюджет задаёт не длина ролика, а предел вложений. В разговоре на claude.ai принимается до 20 изображений на одно сообщение, и на длинную запись эти двадцать делятся по её длительности: чем длиннее ролик, тем реже шаг между кадрами. При вызове из программы предел другой — до 100 изображений на запрос у моделей с окном в 200 тысяч токенов и до 600 у остальных, сторона кадра до 8000 точек. Когда в одном запросе больше двадцати вложений, к каждому применяется более жёсткий предел стороны, и Anthropic советует либо привести каждое изображение к стороне не больше 2000 точек, либо держать запрос в пределах двадцати вложений.

Как отсеять одинаковые. Снимки, взятые ровным шагом, на неподвижной сцене повторяют друг друга и занимают место без пользы. Кадр берут там, где картинка меняется: сменился план, вышел новый человек, сменился слайд в презентации. Из нескольких одинаковых подряд в запрос идёт один.

Из анимированного файла доходит первый кадр. Anthropic называет GIF среди поддерживаемых форматов на странице о работе с изображениями и тут же оговаривает: анимация не поддерживается, используется только первый кадр. Движение показывают набором снимков, взятых в разные моменты записи.

По ссылке доходит сам адрес. Содержимое ролика приносят кадрами и расшифровкой: запись скачивают и раскладывают на картинки и текст. Под это пользователи собрали сторонние модули, которые скачивают запись, режут её на кадры, делают расшифровку и передают всё одним набором.

Claude code видео: как файл попадает в терминал

В Claude Code картинку приносят в разговор тремя способами: перетаскиванием в окно, вставкой из буфера обмена сочетанием Ctrl+V, а на Windows и WSL — Alt+V, или указанием пути к файлу прямо в просьбе. Вставленное изображение подставляется в строку меткой вида [Image #N].

Руководство Claude Code описывает вход картинками. Предел здесь общий для всех способов работы: Claude Code обращается к тем же моделям Anthropic, а их вход в перечне описан как текст и изображение. Поэтому в терминале запись разбирают так же — кадрами и расшифровкой, — а сам ролик заказывают отдельно: руками на странице модели или вызовом GEN202 API видео прямо из кода.

Claude монтаж видео: монтажный план вместо резки

Монтажный план Claude собирает словами, и это настоящая часть его работы. Он раскладывает порядок сцен, назначает каждой длительность, пишет текст диктора и размечает места стыков. Отдельный приём — попросить разбить готовый текст на отрезки ровно по пять секунд и вернуть их таблицей из трёх колонок: что в этот момент звучит, что видно в кадре, что в кадре движется. Дальше по такой таблице идут сверху вниз и заказывают отрезок за отрезком.

Резка, склейка и наложение звуковой дорожки идут в монтажной программе: работают они над самим файлом, а Claude работает словами.

Ту работу, которую ждут от нейросети для монтажа видео, делят между собой два исполнителя. План и порядок сцен пишет Claude. Переделку самой картинки берёт видеомодель: режим «Правка видео» на карточке Wan 2.7 перерисовывает присланный ролик по описанию — так меняют обстановку, одежду или стиль всей сцены разом, и стоит это 9 ₽ за секунду в 720p. Это переделка присланного материала, а не сборка хронометража из кусков: резать и склеивать по-прежнему приходится в монтажной программе. Чем ещё закрывают доработку готового материала, разобрано на странице нейросеть для видео.

Claude генерация видео: чем собирают сам ролик

В перечне моделей Anthropic выход у всех текущих моделей описан как текст, а отдельного семейства для роликов там не заявлено.

Прямой ответ разработчик даёт про соседнюю задачу. На вопрос, может ли Claude создавать и править изображения, страница о работе с изображениями отвечает «нет» и называет Claude моделью, которая изображение только понимает. Что при этом Claude собирает сам, разобрано на странице Claude картинки.

Отдельно про анимацию. Диаграмму, график и интерактивную визуализацию Claude пишет кодом на HTML и SVG прямо в разговоре — так говорит русская справка Anthropic, и функция помечена там бета-версией на Claude web и на рабочем столе. Для схемы или наглядного примера этого хватает, а рисованный ролик для монтажной программы собирают видеомоделью.

Claude написал сценарий — как создать видео дальше

Выбор модели начинается с того, что уже есть на руках. От этого зависят и режим работы, и цена.

Откуда берётся сцена Куда идти Пример цены
Есть только замысел, сцену описывают словами Kling 3.0, Wan 2.7, Seedance 2.0, MiniMax H3 секунда Wan 2.7 в 720p — 9 ₽
Есть готовый кадр, его нужно оживить те же семейства в режиме «картинка в видео» секунда MiniMax H3 в 768p — 5,2 ₽
Есть снятый ролик, его нужно переделать режим «Правка видео» на карточке Wan 2.7 секунда в 720p — 9 ₽
Нужна длительность строго 4, 6 или 8 секунд Veo 3.1 ставки по уровням и разрешениям — таблицей на карточке

Заказ идёт двумя путями. На странице модели ролик заказывают руками: пишут описание, выбирают разрешение и длительность, цена запуска видна до нажатия. Когда ролики нужны потоком, ту же работу делает вызов GEN202 API видео из вашей программы. Полный перечень записей каталога с ценами собран на странице каталог видеомоделей.

Счёт идёт за каждую секунду готового ролика: любая генерация видео платная. Дешевле всего секунда обходится в невысоком разрешении: у Wan 3.0 в 480p она стоит 4,5 ₽, и пятисекундный ролик по этой ставке выходит в 22,5 ₽. При первом входе на счёт начисляют 50 приветственных кредитов, это 25 ₽.

Порядок работы, когда сцену собирают из одного описания, разобран на странице видео по тексту.

Звук в ролике и озвучка

Часть видеомоделей отдаёт ролик сразу со звуком, и в каталоге это отдельные варианты одной записи со своей ценой. У Kling 3.0 при одном и том же разрешении секунда без звука в 720p стоит 7,6 ₽, а со звуком в тех же 720p — 11,3 ₽. В 1080p так же: без звука 10,1 ₽, со звуком 15,1 ₽. Звук здесь приходит вместе с роликом, отдельным файлом его не подставляют.

Когда ролик собран без звука, голос становится следующим шагом после сценария. Текст диктора, который написал Claude, отдают синтезу речи: в каталоге GEN202 такие записи работают через тот же ключ, что и видеомодели. Длинный текст подают порциями, а не одним куском: у большого отрывка, прочитанного подряд, голос выравнивается и теряет паузы.

Частые вопросы

Может ли Claude генерировать видео?

Нет. В перечне моделей Anthropic выход описан как текст у всех текущих моделей. Ближайший прямой ответ разработчика касается изображений: их Claude, по документации, тоже не создаёт и не правит.

Можно ли загрузить видеофайл в чат Claude?

Нет, видеоформатов нет ни в одном перечне поддерживаемых типов, звуковых тоже. Содержимое записи доносят двумя вложениями: кадрами картинками и расшифровкой текстом.

Чем тогда посмотреть ролик целиком?

Моделью, у которой видео стоит на входе. В каталоге GEN202 это Gemini 3.6 Flash и Gemini 3.7 Flash: запись уходит им вместе со звуковой дорожкой, поэтому ими делают конспект видеоурока, разбор созвона и расшифровку.

Сколько кадров можно подать картинками?

В разговоре на claude.ai — до 20 изображений на одно сообщение. При вызове из программы предел выше: до 100 изображений на запрос у моделей с окном в 200 тысяч токенов и до 600 у остальных, при стороне кадра до 8000 точек.

Клод делает видео?

Кириллическое написание указывает на ту же модель Anthropic, и ответ остаётся тем же. Вокруг ролика она работает словами — сценарий, порядок сцен, описания кадров, — а сам ролик собирает видеомодель, и содержимое записи доносят до неё кадрами и расшифровкой.

Монтирует ли Claude видео?

Монтажный план словами Claude собирает: порядок сцен, длительность каждой, текст диктора и места стыков. Резка, склейка и наложение звука остаются за монтажной программой. Готовый ролик целиком переделывает видеомодель — режимом «Правка видео» на карточке Wan 2.7.

Чем сделать ролик и сколько он стоит?

Счёт идёт за секунду готового результата. Секунда Seedance 2.0 Mini в 480p по описанию стоит 6,5 ₽, секунда Wan 2.7 в 1080p — 13,5 ₽. Полный перечень — на странице каталог видеомоделей.

Подойдёт ли готовый ролик как исходник?

Да, но задача при этом другая. Модель перерисовывает присланный ролик по описанию, меняя обстановку, одежду или стиль, и отдаёт его же целиком. Собрать из нескольких кусков один хронометраж таким способом нельзя.

Чат с нейросетью онлайн