这是一篇生成实践
上一篇文章里,我用 7 个 Prompt 实测了 GPT Image 2,最后得到一个结论:好 Prompt 不是一串“高级感、电影感、8K”的形容词,而是一份视觉规格书。
这一次,我想继续往前走一步:一份视觉规格,能不能从一张图扩展到 22 张系列图,再进一步变成一支完整视频?
最初的需求其实只有一句话:
把
awesome-gpt-image-2克隆到项目本地,参考其中的 Prompt 技巧,生成中国历史上各个朝代的图。
随后,需求在生成过程中不断变化:信息太少,需要更全面;每张图要抓住这个朝代最重要的内容;色调不能都一样;场景也不能总是宫殿和人物;最后,还要把整套图片做成一支节奏舒缓、方便阅读的视频。
最终,我得到了一套从夏到清的 22 张高彩历史信息图,以及一支 188 秒的竖屏视频:1080×1920、60fps,每个朝代停留 8 秒,只有非常轻微的推近和叠化,没有旁白,配了一段本地生成的原创器乐。

成片插入位置
公众号发布时,建议在这里单独上传完整成片
final.mp4。本地 HTML 复制到微信编辑器时不会自动携带视频文件。
这篇文章完整记录这次生成过程,重点分享三件事:Prompt 怎样设计,系列图片怎样迭代,以及静态图怎样进入 HyperFrames 视频。
先从 Prompt 案例库里找方法
我把 awesome-gpt-image-2 克隆到本地后,重点看了两类模板:信息图和历史古风题材。
开源项目
freestylefly / awesome-gpt-image-2
https://github.com/freestylefly/awesome-gpt-image-2
信息图模板解决的是结构问题:标题放在哪里,需要几个模块,模块之间怎样建立阅读顺序,文字应该控制到多短。
历史题材模板解决的是内容问题:朝代、服饰、建筑、器物和场景必须明确,还要主动排除现代物品和不同时代元素的混搭。
把两类模板合在一起后,我没有直接写“生成一张唐朝历史图”,而是把任务拆成八个部分:
-
这是什么交付物; -
画的是哪个朝代; -
这个朝代最重要的主题是什么; -
哪些历史信息必须出现; -
用什么场景承载这些信息; -
信息模块怎样排列; -
使用什么色彩、材质和光线; -
哪些错误绝对不能出现。
这一步非常重要。模型如果只收到“唐朝、古风、高级感”,大概率会生成一张穿着古装的人物海报;但我要的不是古风插画,而是一张能够同时表达制度、经济、文化和交流的历史信息图。
第一版:先建立一份朝代信息图母 Prompt
下面这份 Prompt 是根据实际生成过程整理出的可复用版本。它不是从图片元数据中恢复的逐字原始记录,而是把多轮有效约束重新组织成了一份更容易复现的模板。
以唐朝为例,我没有只填“盛唐气象”,而是把变量写得更具体:中心场景是夕阳下的长安市集,商旅、使节、骆驼和坊市共同形成开放交流的画面;一级信息包括三省六部、科举发展、诗歌书法和陆海丝绸之路;色彩使用朱红、琉璃蓝、鎏金和暖橙。
这样生成的重点就不再是“一个唐朝人”,而是长安、制度、文化与交流共同组成的盛唐。
真实生成过程:问题不是不好看,而是信息不够
第一批图片生成后,画面的历史气质已经成立,但问题也很明显:信息太少。
一张图里可能只有朝代名称、一位人物和两三个器物。它能让人感到“这是古代”,却无法回答“这个朝代最重要的变化是什么”。
于是,第二轮生成不再追求增加装饰,而是增加信息结构:年代、一句话定位、制度、经济、文化、人物和历史影响。与此同时,我把每个模块的文字压缩成短标题加一两句说明,避免信息图变成一堵文字墙。
但信息增加以后,又出现了第二个问题:内容很多,重点仍然不够突出。
解决办法不是继续加字,而是为每个朝代确定一个中心命题。比如:
-
秦朝不是简单罗列兵马俑、长城和秦始皇,而是突出“大一统制度的建立”; -
西汉突出中央集权、丝绸之路与帝国扩展; -
北宋突出文官政治、城市商业与科技文化; -
元朝突出行省制度、驿站网络与欧亚交流; -
清朝突出多民族疆域、盛世治理与近代转折。
每张图只保留一个中心命题,其他信息都为它服务。画面因此变得更像知识内容,而不是历史元素拼贴。
第二次升级:解决色调和场景单一
完成一轮后,我发现 22 张图放在一起仍然有明显问题:大量页面都使用暗金、土黄和棕色,主场景也集中在帝王、宫殿和朝堂。
单张看没有大问题,连续观看却很容易疲劳。


因此,第三轮 Prompt 加入了一条新的原则:版式保持统一,场景与色彩必须变化。
这次调整后,唐朝变成夕阳下的长安市集,北宋是雨夜中的汴京商业街,南宋使用日出港口和海贸场景,辽进入雪原行宫,西夏转向星夜沙漠与文字文明,明朝出现窑火、运河与制造业,清朝则用冷雨、铁路和传统城市共同表达近代转折。



这里还有一个很现实的决定:新版标准确定以后,早期已经生成的图片也要重新做。
系列内容不能只看单张图是否好看。只要前后页面的信息密度、颜色或构图明显不同,进入视频后就会产生断层。因此,最后进入视频的不是“每个朝代曾经生成过的最好版本”,而是按同一套高彩标准重新整理过的 22 张最终版本。
从 22 张图片到一支视频
图片完成后,我让 Codex 参考本地 Auto-Vedio 工程中的视频制作 Skill,使用 HyperFrames 组织时间线。
我一开始就提出了一个反常规要求:不要使用太多动画,每一页停留久一点。
因为这些图片本身已经包含大量信息。如果再让标题飞入、卡片弹跳、粒子扫过、镜头快速推拉,观众反而没有时间阅读。视频在这里不是第二次创作一套复杂视觉,而是负责三件事:建立时间顺序、控制阅读节奏、给 22 张图加上统一包装。
最终使用的视频 Prompt 可以整理成下面这份版本:
时间线最终非常简单:
每个朝代进入时先用 0.8 秒完成叠化,随后保留约 7.2 秒稳定阅读。图片在 8 秒内最多放大 1.8%,相邻页面交替进行很轻的横向或纵向漂移。
竖屏适配:宁可保留留白,也不能裁掉正文
最终信息图尺寸约为 1003×1568,并不是标准 9:16。如果直接放大铺满 1080×1920,左右或上下必然有内容被裁掉。
这里采用了一个很实用的两层结构:
-
前景放清晰原图,使用 object-fit: contain,保证整页完整; -
背景使用同一张图放大铺满,再进行模糊、暗化和轻微降饱和。
这样既保留了原图全部文字,又不会出现突兀的纯黑边。深青墨色遮罩与暖金细边框把不同色彩的 22 张图片统一在同一个“数字博物馆展柜”中,而图片本身的颜色仍然保留。
没有旁白,音乐也由本地生成
这支视频没有使用现成音乐,也没有调用付费音乐生成服务。项目里用一段 JavaScript 脚本直接合成了 188 秒、48kHz、双声道 WAV。
音乐由四组缓慢变化的持续和弦、五声音阶倾向的钟声、稀疏拨弦和极轻的空气噪声构成。每 16 秒进行一次和声过渡,钟声约每 4 秒出现一次,拨弦约每 8 秒出现一次;开头淡入 3 秒,结尾淡出 4 秒。
它的作用不是抢走注意力,而是让 22 个静态页面之间保持连续。最终音频平均电平约为 -29.8dB,峰值约为 -18.6dB,整体刻意保持在低干扰范围。
生成视频时遇到的几个真实问题
整个过程并不是一次渲染成功。
首先是字体。HyperFrames 检查发现中文字体发生回退,我把本机使用的宋体、仿宋和 Georgia 字形复制到项目内,并通过 @font-face 固定加载,避免不同环境下片头和片尾排版漂移。
第二个问题是重复素材。最初前景和柔焦背景都使用了 <img>,素材检查会认为同一张图片被重复发现。后来把背景改为 CSS background-image,页面中只保留一个真实的前景图片节点。
第三个问题来自自动巡检。放大的柔焦背景超出画面本来是有意设计,却一度被误判为页码装饰溢出。检查后发现额外页码并没有提供真正的信息价值,于是直接移除,画面反而更克制,重新抽检 30 个时间点后不再出现问题。
最后是 FFmpeg 环境。系统里的快捷入口在受限环境中不可直接执行,项目最终使用本机已有的 FFmpeg 可执行文件和相邻 DLL 完成渲染、探测、黑帧与静音检查。
这些问题都不属于“创意 Prompt”,却直接决定了一套生成素材能否真的变成可交付视频。
最后一步:不要用“看起来不错”代替检查
最终成片进行了几层检查:
-
HyperFrames lint为 0 个错误; validate
没有控制台和对比度错误; -
对 30 个时间点进行布局巡检,结果为 0 个问题; -
片头、22 个朝代和片尾共 24 个关键帧全部生成并人工查看; -
没有检测到持续黑帧; -
没有检测到超过 2 秒的异常静音; -
最终视频为 1080×1920、60fps、H.264 与 AAC,总时长 188.021 秒。
项目评分卡最终得到 96/100。扣分主要来自两个边界:22 页共用一条连续时间线,源文件较长;图片中的历史小字属于 AI 生成的栅格内容,还没有完成逐字 OCR 和专业史实审核。
后一点尤其需要强调:生成质量和内容准确性是两件事。这套图片已经通过版式、完整展示和视频技术检查,但如果要用于正式教学、出版或商业传播,仍应进行人工史实、年代和错别字复核。
这次实践之后,我对 Prompt 又多了一层理解
单张图片的 Prompt 解决的是“这一张画什么”。系列生成的 Prompt 还要解决“哪些东西始终不变,哪些东西必须变化”。视频 Prompt 则继续增加时间、节奏、运动、声音和技术验收。
三者可以写成一条很清楚的链路:
我从这次实践中带走了五条经验:
-
先定义信息结构,再描述视觉风格; -
每个朝代只保留一个中心命题,其他信息为它服务; -
系列一致不等于所有图片使用相同颜色和场景; -
知识型视频首先要给观众阅读时间,动画数量并不是价值; -
AI 可以负责生成和组织,人仍要负责事实、取舍与最终验收。
Codex 在这次任务里更像一个持续工作的生成台:它读取参考项目,整理 Prompt,按顺序管理 22 张素材,再把图片、动画、音乐和检查串在一起。真正让结果从“几张不错的图”变成“一支完整视频”的,不是某一句神奇指令,而是一轮又一轮明确反馈和可检查的中间结果。
如果你也想做一套连续视觉内容,可以先从本文的三份 Prompt 开始:一份控制单张信息图,一份控制系列的色彩和场景,一份控制视频的时间与运动。先生成三张验证结构,再扩展到完整系列,通常会比一开始批量抽卡稳定得多。
项目与成片
Prompt 参考项目
freestylefly / awesome-gpt-image-2
https://github.com/freestylefly/awesome-gpt-image-2
完整成片

发布前边界
22 张图片已经通过版式、完整展示和视频技术检查,但图片中的历史小字属于 AI 生成的栅格内容,尚未完成逐字 OCR 和专业史实审核。用于正式教学、出版或商业传播前,仍需人工复核史实、年代与错别字。
订阅智宅客
AI / 技术 / 数字生活方式,新文章第一时间送到邮箱。








