Video Agent Visual 负责把分镜里的画面真正做出来
在 PromptHub 的 Skill 目录里,Video Agent Visual 是美术师。它读取 storyboard.json,再用 GPTIMG2 批量生成 2K 图片素材,输出 visuals/.png、visual-timeline.json 和 visual-report.md。
Video Agent Visual 负责把分镜里的画面真正做出来
Video Agent Visual 是什么
在 PromptHub 的 Skill 目录里,Video Agent Visual 是美术师。它读取 storyboard.json,再用 GPTIMG2 批量生成 2K 图片素材,输出 visuals/*.png、visual-timeline.json 和 visual-report.md。
它负责的是“把分镜里的视觉要求做成可用素材”,不是重新设计分镜本身。
它最像一个素材执行器
原文把职责写得很直接:读取分镜,理解每个镜头的素材需求,跳过后期制作镜头,批量生成图片,再把结果汇总成视觉时间轴和素材报告。
这意味着它不是单张出图工具,而是面向视频项目的素材流水线。
它最重要的是保持角色和视觉一致
它支持风格配置,原文里给了 default、tech、knowledge 三种预置风格,还要求非后期镜头都要有对应素材文件,文件名和镜头编号一一对应。
这对连贯视频很有用。角色脸、产品外观、场景光线如果前后不统一,后面再好的剪辑也会散。
一个具体示例
假设分镜里有三类镜头:产品英雄图、人物使用图、数据图表。
Video Agent Visual 会去生成前两类的图片素材,数据图表则标成后期制作,让剪辑师去完成。这样素材边界就很清楚,不会把每个镜头都硬塞给图片模型。
它适合什么场景
它适合产品视频、知识视频、科技视频、品牌片和需要统一视觉资产的视频项目。
它不适合让你临时做一套全新分镜,也不适合替代视频剪辑。它只负责视觉素材这一步。
使用边界与失败排查
如果图片风格不统一,先检查是不是没选对 styles/ 里的风格文件。
如果某些镜头缺图,先看是不是被标成 post_production 了,或者本来就应该跳过。
更多说明可以看 Video Agent Visual 的 PromptHub 页面 和 GitHub 原始 Skill 文件。
结论
Video Agent Visual 的价值,是把分镜要求变成可用的图片资产。
它适合承担视频里的“出图执行”环节。