AI Vlog最难的不是生成几个漂亮镜头,而是让人物真的像出去玩了一天。这次我从行程、场景、人物到镜头规划,完整做了一支象山旅行Vlog。
那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~
准备工具
ChatGPT https://chatgpt.com
nanobanan pro https://labs.google/fx/tools/flow/
seedance2.5/seedMusic1.0/seedream5.0pro https://jimeng.jianying.com/ai-tool/home/
Flowpix https://www.flowpix.club
倘若不知道模型怎么使用,可以参考这个教程(https://www.1ai.net/56824.html),与本教程一起使用
一、先确定Vlog故事,再准备场景、人物和道具
做 AI Vlog,我不建议一上来就开始生成视频。
和普通的 AI 氛围短片不同,Vlog 最重要的是让观众相信:
这个人物真的出去玩了一天。
所以第一步,我会先确定一个非常简单的故事和一日行程。
这次我设定的是:
女主去宁波象山玩一天。
整个路线大概是:
早晨起床 → 卧室逗猫 → 出门 → 坐轻轨 → 到达象山 → 海边游玩 → 吃饭 → 拍照 → 看日落。
不需要一开始就写成非常详细的剧本,只要先把这一天大概要做什么想清楚。
确定地点以后,人物服装也会跟着确定。
因为这次主要是在海边,所以女主的服装整体会偏轻盈、自然,更符合旅行和海边环境。

接下来就是找场景图片。
我主要是在 小红书和 Pinterest 中寻找象山相关的参考图。

这里有一个比较重要的要求:
尽量找手机拍摄的图片。
因为最终要做的是 iPhone 日常 Vlog,如果一开始找的全部都是专业摄影、电影剧照或者商业大片,后面即使加入手机运镜,也很容易产生一种广告片的感觉。
筛选图片时也不能只看它好不好看。
我会去想:
如果人物真的出现在这里,她可以干什么?
如果一个场景虽然非常漂亮,但是人物放进去以后没有合理的动作,那么它其实并不一定适合做 Vlog。
除了场景,我还提前准备了两个主要道具:
蓝色 iPhone 17 和富士 X-T30 相机。

这些小道具会让人物的行为更自然,也会增加旅行记录的真实感。
二、把所有素材处理成人物、场景和道具资产
素材找齐以后,我会把它们统一上传到 Flowpix。

不过网上找到的很多场景参考图,本身已经有人物。
如果直接拿去使用,模型很容易受到原图人物影响。
所以对于这些图片,我会先使用 Nano Banana Pro:

输入提示词:去掉左侧的人
我们的目的只是获得一个干净的场景环境,方便后面重新加入自己的女主角。
接下来再处理人物。
我先准备一张女主基础形象,然后使用 Nano Banana Pro 给人物生成一套 4视图。
四视图的作用,就是让模型更加清楚:
这个人物从不同角度到底长什么样。
提示词如下:
生成图中人物的真人形象设定四视图,灰色摄影棚背景,整体为专业真人角色定妆参考板,规整排版,干净简洁,不是海报,不是杂志大片,不要剧情动作,不要复杂场景。
整体版式严格分为上下两部分:上半部分占画面高度三分之一,下半部分占画面高度三分之二。 上方区域展示两张精细真人面部特写,左侧为正面面部特写,右侧为侧面面部特写。两张特写都以头部与肩颈为主,构图紧凑,清晰展示人物五官、骨骼结构、妆容、发型、头饰与神态。人物面部特征、发型、妆造、头部配饰必须与参考形象严格一致。皮肤质感真实自然,保留毛孔、细纹、绒毛、眉睫、碎发与皮肤受光后的细微起伏,不磨皮,不过度锐化,不做人像美容,呈现高解析真人摄影棚定妆照质感。
下方区域展示两张身体与服装参考图,左右排列。
左侧图片必须是放大后的正面服装展示图,人物采用标准 A-pose 站姿。 这一张图的重点不是完整全身入镜,而是“人物尺度明显放大”,让角色在画面中占据更大比例。 左侧图片必须使用更近距离的正面取景,人物从肩颈下方开始入画,到鞋子结束,头部因画面放大而被完整裁切到画面之外。 请注意,这张图不是普通远距离全身照,而是近距离放大的正面服装图:人物身体在画面中的占比要明显更大,上半身与下半身都要被放大展示,整体视觉效果像时装定妆板中的服装主体展示图。
人物双肩、双臂、双手、躯干、腰部、腿部、鞋子必须完整保留,画面边缘只允许裁掉头部,不能裁掉手、脚或身体主体。 左侧这张图必须比右侧背面图看起来更“近”、更“满”、更“放大”,让服装细节和身体比例更突出。 禁止把左侧图做成普通小比例全身图,禁止人物在左侧图中显得太小,禁止头部仍然留在画面内,禁止只裁掉半个头或留出下巴、嘴巴、鼻子、头发边缘。
右侧图片为背面全身图,标准 A-pose,完整展示从头部到鞋子的背面全身。人物背对镜头,完整保留背面头部、发型背部、服装背面结构、鞋子与整体轮廓,用于展示角色背面造型。右侧这张图为常规完整背面全身展示,人物比例正常,不需要像左图那样放大裁切。
下方两张图必须为同一个人物、同一套服装、同一组配饰、同一身体比例。整体保持超模感修长比例,但不要夸张变形。服装设计、布料层次、鞋子、穿搭风格、服装结构与配饰样式必须严格遵循原图。所有服装与配饰都要呈现真实物理材质质感,布料有自然褶皱、垂坠和厚薄变化,金属有真实反光,皮革、丝绸、纱质等材质表现真实自然。若原图服装为开叉长裙,则左侧正面放大图中人物可自然一条腿向前迈出半步,以展示开叉结构和露腿效果,但整体仍需保持定妆照式稳定姿态,不要做走秀动作。
光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。
严格要求:
上方两张脸部特写占画面上三分之一。 下方两张身体图占画面下三分之二。 左下图必须是“放大后的正面服装展示图”,人物在画面中的占比明显更大,头部因近距离取景被完整裁切出画面。 右下图必须是完整背面全身图。 禁止左下图做成普通比例全身小图。 禁止左下图出现任何头部信息。 禁止左右服装不一致。 禁止人物比例漂移。 禁止 AI 油腻感、塑料皮肤感、过度美颜感、廉价 CG 感。

到这里,我们实际上已经准备好了三类素材:
人物资产
场景资产
道具资产
这一步看起来只是整理图片,但它其实决定了后面整支视频的一致性。
三、让Flowpix Agent直接规划整支Vlog
素材准备完成以后,我没有自己一镜一镜去写视频提示词。
而是直接打开 Flowpix 的 Agent 功能。

注意:这个功能是会消耗token积分的!!
然后把这一次需要使用的人物图、道具图以及所有场景图片一起选中。

在此处选择画布中的图片
接下来输入整体要求。
我这次使用的核心提示词是:
我要用AI制作一个vlog视频,以这个角色为女主角图片,用到了以下的场景,这两个是道具,分别是手机和相机(富士X-T30)。 9:16竖屏,真实iPhone日常自拍Vlog。 前摄具有真实手臂距离和轻微广角感;后摄使用0.5x、1x、2x滑动数字变焦和快速推拉。 保留轻微手腕晃动、走路起伏、自动对焦、曝光呼吸和自然运动模糊,不要稳定器般过度平滑。 帮我想一下人物在每一个场景中的画面内容、动作以及神态。 整个故事线从早晨卧室翻身起床开始,然后去卧室逗猫,然后出发坐上轻轨,后面就是Vlog的拍摄。 我希望分成2段,一段生成30秒。

Agent会自己帮你规划好每一镜的画面内容以及人物的动作和神态。

四、把规划转换成Seedance 2.5提示词并生成
Agent 把整支视频规划完成以后,就可以继续让它:
直接给我适合seedance2.5的视频提示词。

这样就不用再重新整理一次。
这次我把整个 Vlog 分成了两段。
每段大约30秒。
相较于一次生成一整分钟,我更建议拆开生成。
不然这么多元素塞进去生成的视频节奏会非常快。
视频内容提示词如下:
提示词1
镜头1(图2卧室,前摄,5秒):清晨阳光洒进卧室,她侧躺在爱心床单上翻身,头发散在枕头上,眯着惺忪睡眼把手机举到脸旁,慵懒小声说”早安,今天要去海边”,晨光在脸上轻微曝光呼吸。
镜头2(图3客厅,前摄举高俯拍,5秒):她蹲在黄麻地毯上伸出手指逗橘猫,橘猫甩尾不理她,她凑近镜头笑着小声说”它又不理我”,百叶窗条纹光影落在她脸上,起身时镜头自然晃动。
镜头3(图4轻轨,后摄1x,4秒):轻轨车厢内她扶着车门扶手背对镜头看窗外蓝色海景,海风吹动长发,她回头对镜头笑,发丝扫过镜头,镜头轻推近她的侧脸。
镜头4(图5招牌,后摄0.5x仰拍,4秒):她举着手机边走边兴奋说”到啦到啦”,镜头从下往上扫过LONELY BAR木招牌和蓝天大海,画面随步伐起伏晃动。
镜头5(图6木路牌,前摄转后摄,4秒):前摄自拍她边走边对着镜头介绍,另一只手拨弄被海风吹乱的头发,然后手腕一翻转为后摄1x对准沙滩木路牌停留一秒。
镜头6(图7秋千,后摄1x推2x,4秒):她坐在海边秋千上背对镜头轻轻荡起,裙摆和长发被海风吹起,镜头从中景缓推到她背影特写。
镜头7(图8大桥,前摄,4秒):她倚着石栏杆自拍半身像,身后是松树与跨海大桥,她歪头对镜头眨眼微笑,举起胸前的富士X-T30对镜头示意。
提示词2:
镜头1(图2岩石泳池,后摄0.5x推1x,4秒):她沿绿松石色水池边走,水面波光反射在裙摆上,她用手遮阳光回头对镜头喊”这里也太出片了”,镜头跟随脚步自然晃动。
镜头2(图3海边茶座,固定自拍,4秒):她把iPhone立在八角桌上入镜,坐在黑色木椅上双手托腮,安静看向滩涂养殖架放空两秒,然后转头对镜头温柔一笑。
镜头3(图4美食,后摄1x俯拍,4秒):她手举HEYA冰饮对着镜头碰杯,镜头扫过炸物拼盘和拌面,画外音”先吃哪个呢”,随后切前摄自拍她咬下一口炸物满足地眯起眼。
镜头4(图5风铃走廊,前摄走路,4秒):她走在贝壳风铃下的木走廊,边走边对镜头说”这家店每个角落都好拍”,抬手轻拨头顶风铃,风铃轻晃。
镜头5(图6HEYA COFFEE,后摄1x推2x,4秒):她站在水池边举起富士X-T30认真取景拍照,然后转身对iPhone镜头开心比耶。
镜头6(图7晚霞,后摄0.5x,3秒):她侧脸剪影对着粉橙色晚霞的海面,轻声感叹”这个晚霞也太治愈了”,渔船从画面右侧缓缓划过。
镜头7(图8日落栈桥,后摄1x快速推拉,4秒):金色夕阳下她沿灯笼栈桥向镜头小跑几步,张开双臂转半圈,裙摆飞扬,逆光剪影大笑。
镜头8(图9码头,前摄,3秒):她倚着木栏杆,脸颊被夕阳染成金色,对镜头挥手说”今天就到这啦,下次见”,然后伸手遮住镜头,画面渐黑结束。
有了内容提示词还不够,还需要资产标注,以及画面质感提示词
画面质感提示词如下:
【画面质感】真实iPhone日常自拍vlog。前摄具有真实手臂距离和轻微广角感;后摄使用0.5x、1x、2x滑动数字变焦和快速推拉。保留轻微手腕晃动、走路起伏、自动对焦、曝光呼吸和自然运动模糊,不要稳定器般过度平滑。
并且女主角需要做一定的描述
女主角严格以图1为准:棕色长直发、右鬓透明百合花发夹、蓝白碎花吊带长裙、四叶草吊坠项链、钻饰手链、白色粗跟凉鞋,淡妆清透。全程手持图9的浅蓝色iPhone拍摄,胸前挂图10的银色富士X-T30相机。
生成时,我会把这一段需要使用的:
人物图 + 场景图 + 手机图 + 相机图
一起连接到 Seedance 2.5 视频模型。

这里一定要注意一个细节:
提示词中的图片引用顺序,要和实际上传图片的排列顺序对应。
比如提示词中:
图1是人物。
图2是卧室。
图3是海边。
图4是手机。
那么模型输入端也必须按照同样的逻辑排列。
如果图片顺序和提示词引用对不上,很容易出现人物拿错道具、场景识别错误,甚至镜头内容完全混乱。
所以每次正式点击生成之前,我都会再检查一次图片顺序。
五、剪映删掉穿帮镜头,再补片头和片尾
视频生成完成以后,我会统一导入 剪映。
这里第一件事情不是加特效,也不是调色。
而是:
删掉不能用的部分。
AI 视频很难保证每一个镜头、每一秒都完全正确。有时候人物本身正常,但是道具发生变化。
这种情况我一般不会硬留。
直接删掉。
在基础剪辑完成以后,我又单独做了一个片头和一个片尾。

这样一来,整支视频就形成了比较完整的时间线:
早晨起床 → 出发 → 旅行 → 游玩 → 日落结束。
如果只把中间生成的镜头直接拼在一起,它更像是一组 AI 旅行素材。
但当人物拥有明确的一日行程,再加上片头和片尾以后,观众才会真正产生一种感觉:
她好像真的去象山玩了一天。
总结
这次 AI Vlog 的整个制作流程,其实可以浓缩成五步:
确定一日行程 → 准备人物、场景和道具 → Agent规划Vlog → Seedance 2.5生成 → 剪映筛选成片。真正影响最终效果的,并不是某一句特别复杂的提示词。
而是你有没有提前把:
人物是谁、去了哪里、带了什么、今天做什么、镜头怎么拍
这些事情想清楚。
当人物、场景、道具和故事线都准备好以后,AI就不只是随机生成一些漂亮的旅行画面。
而是在按照你设计好的一日行程,完成一支真正有开始、有过程、也有结束的 AI Vlog。