Seedance AI
创作技巧

如何让 AI 人物视频更有真实感

从人物一致性、场景逻辑、道具、动作链和时间轴入手,建立一套可复用的真人 AI 视频工作流。

清晰的人脸和细腻的皮肤并不等于真实。一帧截图可能没有明显错误,画面真正运动起来以后,却仍然会产生强烈的“AI 感”。

问题通常不在于少写了一个画质词,而在于人物身份、环境、行动动机和时间之间缺少关系。人物要保持可辨认,光线与空间要符合现实,动作要有原因,前一个动作还要自然引出下一个动作。

下面把这些关系整理成一套可以反复使用的工作流。

1. 真实感首先是关系,不是分辨率

8K超高清电影质感可以改善表面画质,却不能替代人物表演。观众还会无意识地判断:

  • 换一个角度以后是否还是同一个人;
  • 人物受光是否与房间里的光源一致;
  • 视线有没有明确落点,动作有没有原因;
  • 道具被触碰以后,状态有没有正确变化;
  • 动作之间是否存在停顿、反应和收尾。

对比只有标准姿态的人物,和视线、双手、道具能够互相配合的人物:

示例:画面清晰,但人物缺少具体行为目标
下载 MP4
示例:简单的道具互动让人物更像处在真实生活中
下载 MP4

第二种思路更自然,是因为人物能够注意到某件事、伸手完成动作,再回到新的静止状态。真实感往往就来自这些微小而合理的变化。

2. 先锁定人物身份,再设计人物状态

如果角色会重复出现,先准备一张紧凑的人物设定板:

  • 正面和侧面的人脸特写;
  • 清晰的正面服装图;
  • 完整的背面视图;
  • 始终一致的服装、发型、配饰和身形比例。
参考素材:人物四视图与服装设定板
参考素材:人物四视图与服装设定板

生成设定板时,应把它当作制作资料,而不是海报:

生成一张写实人物四视图设定板,使用干净的灰色摄影棚背景。
版式规整简洁,不要剧情动作、装饰文字、海报排版或复杂环境。

上方:两张精细人脸特写,左侧为正面,右侧为侧面。
两张图保持相同的五官结构、皮肤纹理、发型、妆容、耳饰与神态。
保留毛孔、细纹、睫毛、碎发和皮肤的自然受光,不磨皮,不做塑料皮肤。

下方:两张服装参考。
左侧为近距离正面 A-pose,从肩颈以下到鞋子,头部完整裁出画面,
但手臂、双手、躯干、双腿和鞋子必须保留,让服装占据更大画面比例。
右侧为常规完整背面 A-pose,从头部到鞋子,清楚展示发型背面和服装结构。

四个画面必须是同一位虚构成年人、同一套服装、配饰、身材比例和材质表现。
使用统一三点式摄影棚打光与灰色无缝背景。
不要文字,不要服装错位,不要比例漂移,不要廉价 CG 质感。

素材变多以后,为每个输入分配稳定编号。编号只是索引,不是新的角色描述:

图片 1 = 人物 A 的身份和服装,只参考人物。
图片 2 = 临水咖啡店场景和窗光方向,只参考环境。
图片 3 = 咖啡杯道具。
图片 4 = 手机道具。
图片 5 = 普通眼平机位与构图。

人物 A:虚构成年女性,白色无袖上衣、深色长裙、黑色中分长发,气质安静松弛。
工作流:九份素材分别绑定人物、场景、道具、构图和连续性
工作流:九份素材分别绑定人物、场景、道具、构图和连续性

关键不是堆叠更多描述,而是让每个素材只负责一件事,不要让模型猜某张图到底控制人脸、房间、道具、镜头还是光线。

3. 场景要符合真实拍摄逻辑

精致的建筑摄影不一定适合生活化真人视频。真实手机画面可能存在轻微窗外过曝、不够完美的家具位置、充电线、翻开的书或没有整理好的角落。

参考素材:高度控制的室内摄影
参考素材:高度控制的室内摄影
参考素材:带有普通生活痕迹的空间
参考素材:带有普通生活痕迹的空间

选择环境时,重点检查三件事。

光线方向

主光源应该可以被解释。如果窗户在画面左侧,人物通常也应该从相同方向受光。

镜头高度

生活记录优先使用坐姿眼平、胸口高度或普通手持视角。大量极低机位和极端俯拍会让随手记录变成刻意摆拍。

参考素材:方向明确的自然窗光
参考素材:方向明确的自然窗光
参考素材:可信的坐姿眼平视角
参考素材:可信的坐姿眼平视角

空间使用痕迹

可信的房间应该能看出有人真正使用:折起来的外套、喝到一半的水、正在充电的手机、床单褶皱或一本翻开的书。

参考素材:自然光、生活道具和拍摄位置都清晰的临水咖啡店
参考素材:自然光、生活道具和拍摄位置都清晰的临水咖啡店

4. 用道具和动作链解决“人物不知道做什么”

“自然坐着”“轻轻微笑”“看向窗外”过于抽象,模型很难据此组织双手、视线和身体。道具能够给人物明确目标,并产生可以观察的状态变化。

适合真人视频的道具通常很普通:杯子、书、手机、耳机、相机、梳子、钥匙、背包和雨伞。

参考素材:交互方式明确的普通生活道具
参考素材:交互方式明确的普通生活道具

对比两种写法:

较弱:人物自然坐在桌边。

更明确:她低头看向杯子,右手握住杯柄,缓慢拿起杯子,
喝一小口,再把杯子放回原来的位置。
调整前:人物没有明确的行为对象
调整前:人物没有明确的行为对象
调整后:杯子让双手、视线和时间共同指向一个目标
调整后:杯子让双手、视线和时间共同指向一个目标

动作链要比互不相关的动作列表更有效:

她先看向湖面。手机突然震动,因此视线移向屏幕。
她没有马上拿起手机,短暂停顿后反而伸手拿起咖啡杯,
喝一小口,把杯子放下,最后才重新看向手机。

手机制造反应,犹豫制造停顿,杯子提供下一个目标。这种因果关系比单纯增加动作数量更重要。

生成结果:连续完成咖啡店动作链
下载 MP4

5. 用四层结构组织完整提示词

真人视频提示词可以固定成四层:

  1. 拍摄方式:设备感、景别、光线、镜头行为和整体视觉语言。
  2. 素材职责:每张图片、视频或音频具体负责什么。
  3. 镜头时间轴:每个连续时间段里发生什么。
  4. 连续性与限制:哪些内容必须固定,哪些内容不能出现。
完整提示词:拍摄方式、素材职责、时间轴、声音和限制
完整提示词:拍摄方式、素材职责、时间轴、声音和限制

下面是咖啡店案例的完整提示词:

拍摄方式
写实生活纪录片质感,真实手机手持画面,竖屏 9:16,明亮的午后窗光,
轻微手持呼吸感,镜头非常缓慢地靠近人物。

素材职责
图片 1 只定义人物身份。保持相同五官、发型、珍珠耳饰、白色无袖上衣、深色长裙和身形比例。
图片 2 只定义临水咖啡店。保持暖色木质室内、靠窗座位、湖景和自然光方向;忽略参考图里的标注和文字。
图片 3 定义银色手机,图片 4 定义陶瓷咖啡杯。
图片 5 定义朋友坐在圆桌对面的普通眼平视角。
图片 6–9 只定义房间细节、镜头高度、光线连续性和动作连续性。
不要继承任何参考图中无关的人物、物体或文字。

时间轴
0–3 秒:她放松地坐在窗边,带着轻微笑意看向湖面。她逐渐注意到朋友正在拍摄,
自然转向镜头,短暂对视,并露出轻松而不刻意的笑容。

3–6 秒:桌上的银色手机轻轻震动。她低头看向屏幕,没有马上拿起手机,短暂停顿,
随后再次看向镜头,像是在用眼神回应镜头后的朋友。

6–10 秒:她伸手握住杯柄,拿起咖啡杯喝一小口,再轻轻放回桌面。
放下杯子时短暂看向镜头,最后把视线重新落到手机上。

连续性、声音与限制
全程保留自然眨眼、呼吸、轻微歪头、坐姿调整和可信的视线变化。
保持同一个人物、服装、咖啡店、手机、杯子、镜头方向、构图、光线和总时长。
只保留安静的咖啡店环境声和轻微湖边风声。
不要额外人物、字幕、可见文字、Logo、音乐或水印。
时间轴:完整覆盖 0–3、3–6 和 6–10 秒的表演安排
时间轴:完整覆盖 0–3、3–6 和 6–10 秒的表演安排

时间段是节奏规划,不是彼此割裂的剪辑点。每一段都要自然进入下一段,不要留下无法解释的空白。

6. 最后再补画质词

人物、环境、道具、动作和时间稳定以后,再加入简短而具体的质量限制:

自然皮肤纹理,稳定人物身份,双手与道具接触符合物理规律,
窗光方向一致,道具状态连续,轻微手持运动,自然运动模糊;
不要美颜塑料皮肤,不要突然跳镜,不要额外手指,不要道具消失或复制,
不要字幕、Logo 或水印。

不要盲目重复生成,可以根据问题直接修改对应部分:

问题优先修改
换角度后人物变脸身份参考图和素材编号
人物像贴在背景上光线方向、镜头高度和透视
动作机械有因果关系的动作链和停顿
道具跳动、消失或复制道具职责和状态变化
画面过于匆忙减少动作,扩大连续时间段
镜头运动混乱固定一个观察视角,限制运镜

提交前检查

  • 每个人物能否对应到唯一身份参考图?
  • 每份素材是否只有一个明确职责?
  • 主光方向是否符合现实?
  • 镜头高度是否符合预期观察者的位置?
  • 每个主要动作是否有触发原因和可见结果?
  • 是否加入眨眼、呼吸、视线变化和停顿?
  • 时间轴是否连续覆盖完整时长?
  • 是否明确人物、服装、道具、场景、构图和声音限制?

比“是不是 8K”“够不够电影感”更重要的问题是:这个人是谁?现在在哪里?为什么要动?下一秒应该发生什么? 当这些答案清楚以后,提示词才真正开始承担导演的工作。

本页目录