Video Agent Visual 出图时,关键是把素材规则写清楚
在 PromptHub 的 Skill 目录里,Video Agent Visual 是美术师。它读取 storyboard.json,再调用 generateimages.py 批量生成 2K 图片,最后输出 visuals/、visual-timeline.json 和 visual-report.md。
Video Agent Visual 出图时,关键是把素材规则写清楚
Video Agent Visual 是什么
在 PromptHub 的 Skill 目录里,Video Agent Visual 是美术师。它读取 storyboard.json,再调用 generate_images.py 批量生成 2K 图片,最后输出 visuals/、visual-timeline.json 和 visual-report.md。
它的关键不是“会不会生成”,而是“生成给谁看”
原文对输入规则写得很细:ai_video 和 ai_image 的 visual_description 要用英文,15 到 50 个词;manual 用中文说明需要准备什么;post_production 写要展示什么和怎么做动效。
这代表它不是随手写一句“来张高级图”就能稳定工作的。你得先告诉它镜头要什么,素材该怎么分工。
它最实用的用法,是配好风格和并发参数
它支持 --style、--concurrency、--aspect-ratio 三类参数。default、tech、knowledge 是预置风格;并发默认 5;比例默认 16:9,但也能改成 9:16、1:1、4:3、3:4。
如果你在做产品视频,常见做法是先用 tech 或 default 风格出一批 2K 图,再让后续剪辑去处理时间轴和后期镜头。
一个具体示例
如果 storyboard 里有五个镜头,你想让产品英雄图、人物使用图和场景氛围图都统一成科技感,可以把风格设成 tech,比例设成 16:9,并发保持在 5 左右,然后让脚本批量跑完。
出图后再看 visual-timeline.json 和 visual-report.md,确认哪些镜头成功、哪些被跳过、哪些需要人工补。
它适合什么场景
它适合视频素材生产、产品图批量生成、风格统一、角色一致性素材和需要 2K 图像的项目。
它不适合替代分镜,也不适合处理后期图表、字幕或分屏类镜头。那些应该留给后期制作。
使用边界与失败排查
如果图片风格漂了,先换风格文件,不要先怀疑分镜。
如果缺图,先确认是不是 is_post_production 或素材类型设错了。
如果要稳定出图,尽量把 visual_description 写清楚:主体、动作、镜头、光线、风格要具体,不要只写“高级感”。
更多说明可以看 Video Agent Visual 的 PromptHub 页面 和 GitHub 原始 Skill 文件。
结论
Video Agent Visual 的价值,是把分镜表落成可用素材。
它适合认真做视频资产的人,不适合一句话随便出图的心态。