如何让 AI 人物视频更有真实感
从人物一致性、场景逻辑、道具、动作链和时间轴入手,建立一套可复用的真人 AI 视频工作流。
清晰的人脸和细腻的皮肤并不等于真实。一帧截图可能没有明显错误,画面真正运动起来以后,却仍然会产生强烈的“AI 感”。
问题通常不在于少写了一个画质词,而在于人物身份、环境、行动动机和时间之间缺少关系。人物要保持可辨认,光线与空间要符合现实,动作要有原因,前一个动作还要自然引出下一个动作。
下面把这些关系整理成一套可以反复使用的工作流。
1. 真实感首先是关系,不是分辨率
8K、超高清、电影质感可以改善表面画质,却不能替代人物表演。观众还会无意识地判断:
- 换一个角度以后是否还是同一个人;
- 人物受光是否与房间里的光源一致;
- 视线有没有明确落点,动作有没有原因;
- 道具被触碰以后,状态有没有正确变化;
- 动作之间是否存在停顿、反应和收尾。
对比只有标准姿态的人物,和视线、双手、道具能够互相配合的人物:
第二种思路更自然,是因为人物能够注意到某件事、伸手完成动作,再回到新的静止状态。真实感往往就来自这些微小而合理的变化。
2. 先锁定人物身份,再设计人物状态
如果角色会重复出现,先准备一张紧凑的人物设定板:
- 正面和侧面的人脸特写;
- 清晰的正面服装图;
- 完整的背面视图;
- 始终一致的服装、发型、配饰和身形比例。

生成设定板时,应把它当作制作资料,而不是海报:
生成一张写实人物四视图设定板,使用干净的灰色摄影棚背景。
版式规整简洁,不要剧情动作、装饰文字、海报排版或复杂环境。
上方:两张精细人脸特写,左侧为正面,右侧为侧面。
两张图保持相同的五官结构、皮肤纹理、发型、妆容、耳饰与神态。
保留毛孔、细纹、睫毛、碎发和皮肤的自然受光,不磨皮,不做塑料皮肤。
下方:两张服装参考。
左侧为近距离正面 A-pose,从肩颈以下到鞋子,头部完整裁出画面,
但手臂、双手、躯干、双腿和鞋子必须保留,让服装占据更大画面比例。
右侧为常规完整背面 A-pose,从头部到鞋子,清楚展示发型背面和服装结构。
四个画面必须是同一位虚构成年人、同一套服装、配饰、身材比例和材质表现。
使用统一三点式摄影棚打光与灰色无缝背景。
不要文字,不要服装错位,不要比例漂移,不要廉价 CG 质感。素材变多以后,为每个输入分配稳定编号。编号只是索引,不是新的角色描述:
图片 1 = 人物 A 的身份和服装,只参考人物。
图片 2 = 临水咖啡店场景和窗光方向,只参考环境。
图片 3 = 咖啡杯道具。
图片 4 = 手机道具。
图片 5 = 普通眼平机位与构图。
人物 A:虚构成年女性,白色无袖上衣、深色长裙、黑色中分长发,气质安静松弛。
关键不是堆叠更多描述,而是让每个素材只负责一件事,不要让模型猜某张图到底控制人脸、房间、道具、镜头还是光线。
3. 场景要符合真实拍摄逻辑
精致的建筑摄影不一定适合生活化真人视频。真实手机画面可能存在轻微窗外过曝、不够完美的家具位置、充电线、翻开的书或没有整理好的角落。


选择环境时,重点检查三件事。
光线方向
主光源应该可以被解释。如果窗户在画面左侧,人物通常也应该从相同方向受光。
镜头高度
生活记录优先使用坐姿眼平、胸口高度或普通手持视角。大量极低机位和极端俯拍会让随手记录变成刻意摆拍。


空间使用痕迹
可信的房间应该能看出有人真正使用:折起来的外套、喝到一半的水、正在充电的手机、床单褶皱或一本翻开的书。

4. 用道具和动作链解决“人物不知道做什么”
“自然坐着”“轻轻微笑”“看向窗外”过于抽象,模型很难据此组织双手、视线和身体。道具能够给人物明确目标,并产生可以观察的状态变化。
适合真人视频的道具通常很普通:杯子、书、手机、耳机、相机、梳子、钥匙、背包和雨伞。

对比两种写法:
较弱:人物自然坐在桌边。
更明确:她低头看向杯子,右手握住杯柄,缓慢拿起杯子,
喝一小口,再把杯子放回原来的位置。

动作链要比互不相关的动作列表更有效:
她先看向湖面。手机突然震动,因此视线移向屏幕。
她没有马上拿起手机,短暂停顿后反而伸手拿起咖啡杯,
喝一小口,把杯子放下,最后才重新看向手机。手机制造反应,犹豫制造停顿,杯子提供下一个目标。这种因果关系比单纯增加动作数量更重要。
5. 用四层结构组织完整提示词
真人视频提示词可以固定成四层:
- 拍摄方式:设备感、景别、光线、镜头行为和整体视觉语言。
- 素材职责:每张图片、视频或音频具体负责什么。
- 镜头时间轴:每个连续时间段里发生什么。
- 连续性与限制:哪些内容必须固定,哪些内容不能出现。

下面是咖啡店案例的完整提示词:
拍摄方式
写实生活纪录片质感,真实手机手持画面,竖屏 9:16,明亮的午后窗光,
轻微手持呼吸感,镜头非常缓慢地靠近人物。
素材职责
图片 1 只定义人物身份。保持相同五官、发型、珍珠耳饰、白色无袖上衣、深色长裙和身形比例。
图片 2 只定义临水咖啡店。保持暖色木质室内、靠窗座位、湖景和自然光方向;忽略参考图里的标注和文字。
图片 3 定义银色手机,图片 4 定义陶瓷咖啡杯。
图片 5 定义朋友坐在圆桌对面的普通眼平视角。
图片 6–9 只定义房间细节、镜头高度、光线连续性和动作连续性。
不要继承任何参考图中无关的人物、物体或文字。
时间轴
0–3 秒:她放松地坐在窗边,带着轻微笑意看向湖面。她逐渐注意到朋友正在拍摄,
自然转向镜头,短暂对视,并露出轻松而不刻意的笑容。
3–6 秒:桌上的银色手机轻轻震动。她低头看向屏幕,没有马上拿起手机,短暂停顿,
随后再次看向镜头,像是在用眼神回应镜头后的朋友。
6–10 秒:她伸手握住杯柄,拿起咖啡杯喝一小口,再轻轻放回桌面。
放下杯子时短暂看向镜头,最后把视线重新落到手机上。
连续性、声音与限制
全程保留自然眨眼、呼吸、轻微歪头、坐姿调整和可信的视线变化。
保持同一个人物、服装、咖啡店、手机、杯子、镜头方向、构图、光线和总时长。
只保留安静的咖啡店环境声和轻微湖边风声。
不要额外人物、字幕、可见文字、Logo、音乐或水印。
时间段是节奏规划,不是彼此割裂的剪辑点。每一段都要自然进入下一段,不要留下无法解释的空白。
6. 最后再补画质词
人物、环境、道具、动作和时间稳定以后,再加入简短而具体的质量限制:
自然皮肤纹理,稳定人物身份,双手与道具接触符合物理规律,
窗光方向一致,道具状态连续,轻微手持运动,自然运动模糊;
不要美颜塑料皮肤,不要突然跳镜,不要额外手指,不要道具消失或复制,
不要字幕、Logo 或水印。不要盲目重复生成,可以根据问题直接修改对应部分:
| 问题 | 优先修改 |
|---|---|
| 换角度后人物变脸 | 身份参考图和素材编号 |
| 人物像贴在背景上 | 光线方向、镜头高度和透视 |
| 动作机械 | 有因果关系的动作链和停顿 |
| 道具跳动、消失或复制 | 道具职责和状态变化 |
| 画面过于匆忙 | 减少动作,扩大连续时间段 |
| 镜头运动混乱 | 固定一个观察视角,限制运镜 |
提交前检查
- 每个人物能否对应到唯一身份参考图?
- 每份素材是否只有一个明确职责?
- 主光方向是否符合现实?
- 镜头高度是否符合预期观察者的位置?
- 每个主要动作是否有触发原因和可见结果?
- 是否加入眨眼、呼吸、视线变化和停顿?
- 时间轴是否连续覆盖完整时长?
- 是否明确人物、服装、道具、场景、构图和声音限制?
比“是不是 8K”“够不够电影感”更重要的问题是:这个人是谁?现在在哪里?为什么要动?下一秒应该发生什么? 当这些答案清楚以后,提示词才真正开始承担导演的工作。