【AI动漫资产库 · 第 2/19 篇】讲解如何用图片建立空间结构,实现 AI 动漫连贯镜头的空间逻辑。
😘AI漫剧新手必看2-AI制作连贯镜头-空间结构(图片建立空间结构方面的讲解)2026.05.23总结
你有没有发现,AI动漫的画面都非常跳跃!而且偏快节奏(眼花缭乱)的多,慢节奏的几乎没有?在大空间内的比比皆是,在小空间内的很少看到?让你走马观花的感觉。现在AI绝大部分作品也是这个问题。你只能看个大概,没法被故事带入情感!
现在AI动漫剧的难点,其实就出现在“快“这个字上。太快了!!!!!
动漫嘛!有个"慢“字。慢下来才是核心,也才能让故事正常推进,有人物沟通,有故事发展。你有没有想过,为什么慢不下来?
某实我认为最核心的原因,就是有一个反直觉的冷知识:那就是AI其实不适合拿来做连续剧情,所以大家都在做跳跃的内容。
AI的核心缺陷是"无叙事逻辑”:
AI只关注单顿画面的“好看”,但无法理解“系列分镜需要服务于故事连贯”。
但是分镜的本质是什么?分镜的本质是“视觉化的故事线”。所以AI天生是不能直接生成一个具有故事线的动漫,
如果你想要把故事线很好的讲述出来,就一定要人为干预。这也是我认为,AI不可能自主的完成一本动漫的原因。
但这也不意味我们无法通过使用AI就做出一个非常棒的动漫!只是要克服许多的问题!
今天我们来讲要克服AI动漫不连续的最大难题,就是空间结构,这个是我个人认为AI无法慢下来的根本原因。
现在各家的模型,基本都能解决“人物一致性“的问题了,但是空间结构的一致性,却鲜有人提!相信未来各家模型的主攻的解决方向,就会是这里!
构建分镜空间逻辑
误区:大家都在说人物一致性,但是空间一致性同样重要!
问题:**空间结构做的好加分,空间结构做不好大大减分!**不信你看这个
核心原则:
建立观众的空间感,固定的物品(房子、墙板、门、壁橱、桌子、椅子等等),它的空间位置就不能随意变换。
尤其是主要场景(经常要出现的场景)!
这里引用了景别递进逻辑!思维
1.通过远镜头建立空间感 整体房屋结构通过景别转换,建立的空间结构,给人强烈的记忆锚点




通过远镜头交代房屋整体布局,固定镜头下人物移动,其他物品保持静止,如《魔女宅急便》中琪琪从门口跑到厕所的镜头,一次性交代房屋结构。
2.结合近景镜头将观众带入房屋,交代房屋内部结构

远景锚定空间后,通过近景展示工作台、门窗等细节,使观众对场景产生立体认知,例如明确工作台朝向、窗外景象与室内物品的对应关系。
面包店全景图

此外,画面中出现的车子、柜子等等不动的东西,都是空间构成中重要的内容。所以我们在操作的时候,要注意这些。
观众有空间结构的好处:
- 1,超强的代入感!
- 2,很自然,比一般站着说话的动漫要丰富,更抓人眼球!产生记忆点!
- 3,看起来不割裂,换个词就是“顺眼”
如果空间结构混乱的,那么基本就是大大减分了,我们可以看下这个视频,注意桌子的位置。
人物虽然保持一致性了,但是场景没有保持,同时空间结构乱了。画面就感觉不连贯不自然,产生割裂感!
3.接受细微误差
核心物品位置需保持一致(如桌子、楼梯),次要细节允许误差,空间结构 + 物品相似度达到 80% 即可,避免过度消耗时间在非关键细节上。

4.次要场景不要费力构建
仅针对高频出现的主要场景(如主角卧室)构建空间结构,次要场景(如临时出现的超市)只需通过关键镜头交代功能即可,避免增加观众认知负担。

实操讲解

**分镜制作实操步骤 **
**1.建立分镜脚本 **
需在脑海中预先构建每个画面的动态效果,以琪琪面包店案例为例,分镜包括:琪琪看店、电话响起、接电话、与店主交谈、跑出门店五个核心场景。
**2.生成参考图 **
参考图质量直接影响最终效果,制作时间应多于视频合成时间。以远视图作为空间基础,明确固定物品位置,通过豆包生成多视图,选择最符合空间逻辑的图片。
**3.生成视频分镜 **
采用 "一个分镜一个分镜制作" 的方法,使用首尾帧推进或手帧固定镜头,保持色调统一,通过提示词控制镜头运动(如 "镜头缓缓推进,少女微笑靠在桌子上")。
4.人物配音制作
使用 Minimax 生成语音,注意匹配人物口型,远景可粗略配音,近景建议使用数字人功能确保口型同步,日语配音可通过豆包翻译后生成。
**5.剪辑要点 **
分镜时长控制在 2-10 秒,保留优质帧数,适当加速处理;音效与 BGM 是关键,需匹配场景氛围;配音需对好嘴型,近景用数字人,远景可简化处理。
分镜脚本
这里我们来手写一下分镜脚本吧.
- 分镜1:琪琪在面包店中看店。
- 分镜2:电话突然响了,电话机跳了起来。
- 分镜3:琪琪兴奋的站起来接电话。
- 分镜4:琪琪和女店主交代,女店主答应。
- 分镜5:琪琪从店门口出去。
分镜参考图规划
在制作参考图前,我们还有几个重要的工作,就是先在脑海中拟定整个画面!当你脑海中有画面的时候,先对分镜脚本进行设置。
- 分镜1:琪琪在面包店中看店(首帧图,镜头从远处缓慢推近)这里需要有一个额外分镜,琪琪正面,这个做首尾帧。
- 分镜2:电话突然响了,同时电话机跳了起来(首帧图,固定镜头)
- 分镜3:琪琪兴奋的站起来接电话(首帧图,首顿是分镜1的额外分镜,尾帧是琪琪拿起电话,如果不行就多分一个额外分镜)
- 分镜4:琪琪和女店主交代,女店主答应(首帧图,女店主画面,首帧是女店主织毛衣,然后听琪琪讲话,然后再织毛衣)
- 分镜5:琪琪从店门口出去(首帧图,首帧空景,尾帧人物)
确立空间结构+主要场景(用豆包就够了!别整那么多花里胡哨的)
1.分镜1
我以一个魔女琪琪的分镜来做演示。(如果是自建角色的话,通常需要多轮对话完成,琪琪是知名角色·现在我生成一个琪琪的图片了,然后我想要一个空间图,因为现在只有面包房的一小部分!

帮我生成图片:根据这张图,画几张面包店的多视角图,空间结构固定化!
这次生成的第三张图还可以,但也没有清晰的展现空间结构。正确的沟通方式,构建空间结构!








































分镜实例
提示词 使用公式 ——–
介绍:主要是给人物和场景起名,让AI知到谁是谁,那个场景是哪里
分镜*n(镜号+时间+运镜+画面描述+台词+转场+音效+台词)
负向提示词+质量提示词
实例1:
1 @图片 1 是店里的全貌,@图片 2 是店门口左边的窗户。@图 3 是角色 C, @图片 4 是角色 B, @图片 5 是角色 A。请严格按照我的分镜头制作镜头:
2 镜头 1: 0-3s, 角色 B 和角色 A 正在店内谈天,他们一边打扫,一边在交流。角色 B 显得非常开心。可以单独给他们两人一人一个镜头。固定镜头
3 镜头 2: 3-4s 特写,切镜至角色 A, 。她惊讶发现店门口的窗户上有一个人。固定镜头
4 镜头3: 4-5s 硬切,近景,是角色 C 趴在窗口,她只露出了半个脑袋,眼睛一直恶狠狠的盯着店里的角色 B。固定镜头
5 镜头 5:7-8s,硬切,近景,角色 B 单人在画框内,角色 B 愣住,然后露出一阵恶寒的表情。固定镜头
6 镜头 6:8-10s,硬切,近景,镜头切回角色 B,角色 B 依然是镜头 3 的表情,然后像老虎一样模拟撕咬的动作。固定镜头
7 镜头 7:10-12s,硬切,近景,角色 A 手驻额头,闭上眼睛,万分无语,喃喃自语道:“怎么这家伙也来这里了”。固定镜头
8镜头 8:12-13s,硬切,特写,角色 A 单人在画框内,露出了 “啊” 的表情,头上冒出 3 个疑惑的红色小问号
制作 细节 负向提示词 必须加上 “不要在画面底端出现字幕”,还有bgm
视频制作中 采取 参考分镜图 +切换关键帧的方式 指定 做转场效果 配合 画面描述 做到完美控制
整个视频 15S
实例2:
1 @图片 1 是店里的全貌,@图片 2 是店门口左边的窗户。@图 3 是角色 C, @图片 4 是角色 B, @图片 5 是角色 A。请严格按照我的分镜头制作镜头:
2 镜头 1: 0-3s, 角色 B 和角色 A 正在店内谈天,他们一边打扫,一边在交流。角色 B 显得非常开心。可以单独给他们两人一人一个镜头。固定镜头
3 镜头 2: 3-4s 特写,切镜至角色 A, 。她惊讶发现店门口的窗户上有一个人。固定镜头
4 镜头3: 4-5s 硬切,近景,是角色 C 趴在窗口,她只露出了半个脑袋,眼睛一直恶狠狠的盯着店里的角色 B。固定镜头
5 镜头 5:7-8s,硬切,近景,角色 B 单人在画框内,角色 B 愣住,然后露出一阵恶寒的表情。固定镜头
6 镜头 6:8-10s,硬切,近景,镜头切回角色 B,角色 B 依然是镜头 3 的表情,然后像老虎一样模拟撕咬的动作。固定镜头
7 镜头 7:10-12s,硬切,近景,角色 A 手驻额头,闭上眼睛,万分无语,喃喃自语道:“怎么这家伙也来这里了”。固定镜头
8镜头 8:12-13s,硬切,特写,角色 A 单人在画框内,露出了 “啊” 的表情,头上冒出 3 个疑惑的红色小问
订阅智宅客
AI / 技术 / 数字生活方式,新文章第一时间送到邮箱。








