首页 新闻 会员 周边

AI视频生成首尾帧技术实测:两张静态图如何生成10秒动态舞蹈(附完整prompt)

0
悬赏园豆:30 [待解决问题]

最近在做 AI 视频生成的技术实验,重点测了首尾帧锁定(first-last frame):你给模型两张静态图,指定一张是开场、一张是结尾,模型自己脑补中间所有动作。这篇把踩过的坑和最终可用的 prompt完整贴出来,省得后面的人重复交学费。
实验素材
两张 Y2K 风格的屋顶胶片照(也是 AI 生成的):

  • 首帧:女孩侧身站在天台,一手扶被风吹乱的头发,一手向镜头伸出,背景是夕阳、水箱、太阳能热水器
  • 尾帧:倾斜仰角的极近特写,她低头浅笑,手掌遮住画面左上角,背景强烈过曝,阳光从指缝漏出
    目标:生成 10 秒视频,让她从"牵手"到"独舞"再到"盖镜头",全程保持胶片质感。
    关键认知:写节拍表,不要写氛围
    一开始我也以为写 Y2K胶片质感,屋顶夕阳,女孩跳舞就够了。结果崩得一塌糊涂——中段五官漂移、手指畸变、尾帧还会突然跳到另一个机位。真正有效的写法是像写分镜表一样按时间戳拆解动作。下面是最终成片用的完整 prompt:
    图1为视频首帧:夕阳屋顶天台,逆光胶片质感,黑色吊带背心的长发女孩侧身站立,一只手扶着被风吹乱的头发,另一只手向镜头伸出、牵住镜头前的手,眯眼灿烂微笑背景有水箱和太阳能热水器剪影。
    图2为视频尾帧:镜头变为倾斜仰角的极近距离面部特写,女孩低头看向镜头浅笑,她的手掌伸到镜头前遮挡住画面左上角,背景强烈过曝,夕阳光从指缝和发丝间透出。
    0-2秒:女孩保持首帧姿势,笑着牵住镜头前的手,拉着镜头向后退,脚步轻快,肩膀随节奏左右摇摆,长发被风吹乱,镜头手持轻晃跟随。2-5秒:她松开手,退到天台中央,张开双臂迎着风轻盈地转了半圈,像在屋顶翩翩起舞,长发和逆光光晕随身体飞扬,边转边回头对镜头灿烂大笑。5-8秒:她朝镜头快步走近,伸手勾向镜头,镜头缓慢持续推近并逐渐上扬倾斜,她的脸在画面中越来越大,夕阳光晕越来越强。8-10秒:她低头凑近镜头大笑,抬起手掌盖向镜头左上方,指缝间透出耀眼夕阳光斑,画面过曝被暖光淹没,精确落在图2尾帧的构图上。
    全程:胶片颗粒,轻微手持晃动,Y2K复古暖色调,真实抓拍感。
    负面提示词:面部扭曲,五官变形,手指畸变,多余手指,多余的手,肢体断裂,画面闪烁,突变跳帧,文字水印
    五条踩坑经验
  1. 写"转半圈",别写"转一圈"。 10 秒视频里让人物原地旋转一整圈,五官在背对镜头再转回来的过程中必定漂移,我连崩三次。改成"转了半圈"之后立刻可用。这是我认为最值钱的一条。
  2. 运动幅度开中档。 长时长加高运动幅度等于五官糊成一团,这是各家模型的通病,不是某一个模型的问题。
  3. 必须在 prompt 里复述尾帧的机位。 写上"镜头逐渐上扬倾斜""精确落在图2尾帧的构图上"这类描述,否则最后两秒会突然跳到一个平视机位,和你给的尾帧接不上,收尾非常难看。
  4. 首尾帧的锚点声明别省。 开头必须明确写 图1为视频首帧:... 和图2为视频尾帧:...,并把两张图的内容各描述一遍。不写清楚,模型会把它们当成风格参考图而不是硬约束。
  5. 中段(离首尾帧最远的那几秒)是崩坏高发区。因为两端都有图片约束,中间最自由。所以复杂动作要么放在靠近首尾的位置,要么把幅度写小。
    模型选择
    我通过 velokey.ai 这个统一 API 测不同模型,同一套 prompt 一键跑 Kling、Sora、Runway、Veo 做A/B,不用反复注册账号和分别充值,抽卡型任务这么搞省事很多。
    粗略对比下来:Sora 对首尾帧的约束最强、几乎不跳变,但速度慢;Runway 便宜,10 秒容易糊;Veo色彩还原好,国内访问不稳。这次屋顶舞蹈是 Kling 2.x 出的,第 3 次尝试成片,成本约 0.4 美元。
    成片实际效果
    抽帧逐秒核对(ffmpeg 每秒抽一帧)后,节拍基本全踩上了:
  • 0-1s 牵手回眸——比计划短,大约 1 秒就松手了
  • 2-4s 转身甩发、张臂旋转——全片高光,逆光给发丝镀金边那两秒最出片
  • 5-7s 笑着走近,还即兴朝镜头点了下手指
  • 7-10s 手掌从左上伸入遮挡,暖光淹没画面,落点和尾帧几乎一致
    10 秒长度下五官全程稳定、手指没有畸变,转身段也扛住了。唯一瑕疵是牵手互动被压缩,"双人舞"的感觉没出来就直接进独舞了,不过衔接自然,观感上不突兀。另外原图颗粒偏重、生成部分质感偏干净,开头有极轻微的质感跳变,叠一层统一颗粒滤镜就能抹平。
    几个还没解决的问题
  1. 其他模型的首尾帧功能有人试过吗? Pika、Genmo、Morph 这几家的约束力和 Kling 比如何?
  2. 时间戳写法有没有更精确的形式? 我现在是手写秒数区间,不知道有没有 JSON 或类似 DSL 的结构化写法能提高遵循度。
  3. 第一人称"伸手入画"怎么稳住? 我首帧里有一只伸向镜头的手,生成时这只手经常抖动或凭空消失,有解法吗?
    做过类似实验的朋友欢迎交流,有相关论文或博客也请推荐。
velokey的主页 velokey | 初学一级 | 园豆:172
提问于:2026-07-28 13:32
< >
分享
清除回答草稿
   您需要登录以后才能回答,未注册用户请先注册