面部特写最怕假、僵和换脸。这篇AI教程从一张人脸图出发,讲清楚如何先定画质,再让表情自然发生。
那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~准备工具
seedance2.5/seedream 5.0pro
倘若不知道模型怎么使用,可以参考这个AI新手教程(https://www.1ai.net/56824.html),与本教程一起使用
一、先把初始图片做好
制作面部特写视频时,初始图片基本决定了最终画面的质感。
如果图片中的皮肤、眼睛、头发和妆容不够真实,后续生成视频时很难完全补救。尤其是面部几乎占满画
面的构图,五官和皮肤上的问题都会被放大。
因此,第一步不是急着制作视频,而是先得到一张真实、精致、自然的人物面部图片。
这张图最好满足几个条件:
面部几乎占满画面;
颅顶被画面自然裁切;
底部只露出少量脖颈;
面部明亮,但不能过曝;
发型、眼线、唇膏和整体妆容清晰;
背景干净、虚化,但不要出现发光背景;
表情放松,不瞪眼,也不刻意微笑。
二、先找面部参考,再提取五官特征
直接让AI凭空生成一个”漂亮人物”,结果通常比较随机,人物也容易缺少辨识度。我的方法是先寻找一张自己喜欢、有特点的面部参考图。但这张图不会被直接用于图生图,只用来帮助AI观察和提取五官特征。
这里可以去小红书/pinterest等等平台去寻找图片

这样做的目的,是把参考图中的脸型、眉眼、鼻子、嘴唇、发型和妆容转化成文字,再通过纯文生图生成一个新的AI人物。
可以把参考图上传给AI,然后使用下面这段提示词:
我有一张人物面部参考图,准备制作一个新的AI人物。请分析并提取画面中可见的脸型、眉毛、眼睛、眼线、鼻子、嘴唇、肤色、发型和妆容特征,整理成一段可以直接用于纯文生图的中文提示词。正式生成图片时不会使用这张参考图,因此五官特征需要描述得具体、准确,并保持妆容和发型一致。构图采用超近距离正面面部特写,面部几乎占满画面,颅顶明确出画,顶部头发被画面裁切,底部只露出少量脖颈,不出现肩膀。人物面部明亮、自然、细腻,不过曝;背景干净,具有轻微浅景深虚化,但不出现光圈、光斑、轮廓光或发光背景。人物表情松弛自然。最后提供完整提示词和反向提示词。

这里最重要的是告诉AI:我们需要的是”可用于纯文生图的文字特征”,而不是让它直接照着参考图生成。
三、使用文生图模型制作初始图
拿到整理后的面部提示词,就可以进入文生图阶段。
我这次使用的是即梦Seedream5.0Pro。在这次相同提示词的对比中,它生成的人物在五官、皮肤和整体精致度上更符合我的预期。

我也尝试了Image2.0和NanoBanana Pro,但在本次案例中,生成结果的真实感和人物精致度没有达到同样的效果。这只是本次提示词和人物类型下的对比结果,不代表所有任务都会得到相同结论。

四、不要准备太多表情参考图
开始时,我尝试准备多张不同表情的参考图,希望模型按照顺序完成表情变化。

实际测试后发现,表情图太多容易产生两个问题:
第一,人物会像在逐张切换图片,表情变化速度过快;第二,眉毛、眼睛和嘴巴容易同时变化,看起来比较机械。
最后我减少了表情参考,进一步改成只使用一张初始图,让A根据动作和情绪逻辑自由生成中间表情。
参考图负责锁定人物,提示词负责安排表演。这样得到的视线移动、眨眼、转头和表情变化通常更加连贯。
五、让AI推导视频提示词
我使用的通用提示词如下(括号处可以自己改)
得到满意的初始图后,再让AI根据图片、时长和关键动作编写视频提示词。
你是一名擅长人物微表情、表演调度和AI视频生成的导演。请根据我提供的人物参考图、视频时长和关键事件,推导一段自然、连贯、可直接用于图生视频模型的中文提示词。
我的信息:
– 人物参考图:【上传图片或填写文件路径】
– 视频时长:【填写秒数】
– 关键事件:【填写主要动作】
– 事件发生时间:【填写时间点】
– 其他要求:【填写构图、光线、背景、镜头或情绪要求】
请按照以下方法设计:
1. 先识别参考图中人物的初始表情、视线方向、头部角度、构图、发型、妆容、光线和背景。参考图是人物外貌与首帧基准,不重新设计人物。
2. 把整段视频设计成具有因果关系的连续表演,例如:初始状态→察觉变化→注意力转移→事件发生→本能反应→恢复→最终情绪。不要为了丰富画面而加入没有原因的惊讶、嘟嘴、生气或微笑。
3. 参考表情只作为情绪锚点,不要求逐张定格复刻。允许出现参考图之外的自然中间表情、视线变化、眨眼、呼吸、轻微转头、低头、抬下巴和身体受力反应。
4. 表情不能机械同步变化。眼神、眼睑、眉毛、头部、面颊和嘴角应分先后启动。例如眼睛先察觉,头部慢半拍跟随;眉毛先产生反应,嘴角随后变化。
5. 每次情绪变化都应包含:预备动作、表情形成、短暂余韵和向下一状态的衔接。动作速度有快有慢,保留真实的反应延迟和轻微左右不对称。
6. 如果存在手部接触、触碰、捏脸或推拉动作,详细描述手的进入方向、运动轨迹、接触时间、手指位置、皮肤受力、脸颊变形、头部跟随、松开后的回弹和人物后续反应。动作必须符合真实物理规律。
7. 锁定人物一致性:五官、脸型、年龄、肤色、发型、眼线、唇膏和妆容不变。锁定镜头、构图、曝光、光线与背景,除非我明确要求改变。
8. 根据视频总时长安排合理节奏。明显表情不宜过多,每个主要情绪必须有足够的形成和停留时间。不要把多个表情平均分配成机械的时间节点。
请按照以下格式输出:
一、设计依据 用简短语言概括初始状态、情绪触发点、反应链条和最终状态,不展开冗长分析。
二、完整视频提示词 包含:
【画面与人物锁定】 描述人物一致性、构图、镜头、画质、光线和背景。
【连续动作时间线】 按照具体秒数描述视线、头部、眉眼、嘴角、呼吸、互动动作和情绪发展。
【自然表演规则】 强调动作先后、反应延迟、轻微不对称、过渡表情、受力反馈和情绪余韵。
【反向提示词】 排除换脸、五官漂移、机械变脸、所有五官同时变化、无原因表情、说话口型、面部液化、手指畸形、镜头乱动、曝光闪烁和背景变化。
最终提示词必须具体、连续、具有可执行的时间线,但不要写成逐帧说明;重点描述一连串具有因果关系的动态过程。

还有关键的画面质感提示词,放在最前面,大家可以稍作修改后复制使用:
以参考图为唯一人物基准,只改变表情,保持脸型、五官、肤色、发型、眼线和玫瑰粉水光唇膏不变。 超近距离正面面部特写,人物平视镜头,脸部几乎占满画面;颅顶明确出画,顶部头发被画面裁切,左右部分头发出画,底部只露出少量脖颈,不出现肩膀。 相机与双眼平齐,100mm人像镜头,固定机位、固定焦距、焦点锁定双眼;无推拉、无摇移、无镜头晃动。正面偏上的大面积柔光均匀照亮面部,肤色明亮但不过曝,光线与曝光始终稳定。背景保持干净的低饱和浅灰粉色,不发光,无光圈、光斑、散景、逆光和轮廓光。 4K超写实人像画质,皮肤、睫毛、唇纹和发丝清晰自然,连续帧稳定,无闪烁、重影、液化或五官漂移。

视频内容提示词如下:
0—1.2秒:人物没有看镜头,头部轻微偏向一侧,视线自然落在镜头侧下方,面部肌肉完全放松。保持轻微呼吸,眼球产生细小自然移动。
1.2—1.5秒:人物像察觉到镜头,只有眼睛快速瞥向镜头,与镜头短暂接触;头部暂时不动,视线随后自然移开,不做明显表情。
1.5—2.5秒:人物轻轻眨眼,视线在镜头旁停留片刻。嘴唇保持放松,头部随呼吸产生毫米级浮动,神态安静自然。
2.5—3.8秒:视线缓慢重新移回镜头,头部慢半拍轻轻转正。眼睛先完成对视,头部随后跟随,最终自然地看向镜头。
3.8—5.8秒:人物安静保持对视,不刻意微笑,也不摆出特定表情。期间自然眨眼一次,眼神出现轻微聚焦变化;嘴唇偶尔轻轻收紧再放松,下巴随呼吸产生细小运动。
5.8—6.8秒:人物余光察觉画面右侧有东西靠近,瞳孔轻微向右偏移,一侧眉毛只有非常小的抬动,呈现自然的注意与疑惑,不要突然惊讶或瞪眼。
第7秒,一只真实自然的女性手从画面右侧伸入。手指纤细,五指结构正确,短而整洁的自然色指甲,不佩戴饰品。
7.3秒,拇指和食指轻轻捏住人物画面右侧脸颊的一小块软肉。脸颊随压力自然凹陷,周围软肉轻微鼓起,嘴角产生真实的不对称牵动。
人物先短暂愣住,被捏一侧的眼睛本能地轻轻眯起,另一只眼睛略微睁大;眉毛产生细小反应,嘴唇轻轻抿住,头部顺着力量向另一侧移动几毫米。反应自然克制,像突然被熟悉的人捏了一下脸,而不是夸张表演。
8.1秒手指松开,脸颊柔软回弹,手在8.5秒前退出画面。人物眨眼一次,先露出短暂的无奈神态,随后一侧嘴角忍不住上扬,另一侧慢半拍跟上。
8.5—10秒:人物逐渐形成温柔、松弛的闭唇微笑,眼神重新回到镜头。最后轻轻呼吸并自然眨眼,笑意主要停留在眼睛和嘴角。
前7秒不出现明显惊讶、嘟嘴、生气或委屈,只表现真实的视线变化、呼吸、眨眼和细微神态。人物不说话,无口型,无机械变脸、面部液化、手指畸形、镜头移动或光线闪烁。
六、把图片和提示词交给视频模型
最后,将初始图片和生成好的视频提示词上传至Seedance2.5,设置需要的视频时长并开始生成。(建议先生成480p进行调整,最后生成1080p,质感完全不一样)
