跳到主要内容

上下文从 1 秒扩到 10 秒,这条就够我推一次

书签客
书签客

· 阅读约 3 分钟

这条在讲 Gemini Omni 1.1 Flash,8 月 27 日发的,出处是 Google DeepMind 的 Anish Nangia 和 Alisa Fortin 署名。定位说得很清楚:面向开发者的生产就绪更新,重点放在生成式视频的控制能力上。

我扫完前半段,感觉像在翻一列功能清单——场景延伸、首帧末帧、多模态参考,一条条排过去。读到第三段才停下来,是看到作者写场景延伸能分析最多 10 秒的已有视频上下文,之前只参考最后 1 秒。

之前只参考最后 1 秒。这个改动比后头那些功能更实在。只给模型看最后一帧,它就等于没看前因后果地往下续;10 秒上下文一开,前面发生过什么、角色往哪边动、镜头怎么摇,它才真正有东西能参照。这个东西不是参数表上多一个数字,是续写逻辑变了。

看到这条我没忍住,顺手跑了一下。在 Google AI Studio 里调的 Gemini API。给它的任务是:拿一段 8 秒的推轨镜头,从最后一帧接着延伸 10 秒。

你:参考下面这段 8 秒视频,从最后一帧处继续延伸 10 秒,保持原场景和动作方向。
[上传片段:仓库门口的推轨镜头,人物从左向右走]

返回前先说我自己的预期——没抱太大期望。10 秒上下文这种说法,文档写得好看,真跑起来经常还是只肯看最后一秒。

返回:延伸片段 10 秒。前 2 秒人物继续从画面左侧走向右侧,速度不变。第 3 秒开始镜头轻微右摇,人物身体微转但没有走出画面。第 7 秒人物接近门框,第 9 秒完全进入门内,最后 1 秒镜头停在门框上,画面稳定。

这次是真参考了前面。镜头轻微右摇那一下,不是从最后一帧能硬猜出来的——原片段里镜头本来就是往右推的,它延续了这个趋势。这段跑通了。

接着试首帧末帧。就是模型支持在指定两帧之间生成连续视频那条。我给了它首帧是人物站在窗前,末帧是镜头绕到人物侧面,要求环绕运镜。

你:在以下两帧之间生成连续视频,要求环绕运镜。
[首帧:窗前人物正面全景]
[末帧:人物右侧半身,镜头绕到一侧]
返回:20 秒片段。中间第 8 秒附近出现同一帧重复,之后动作续上,但跟末帧衔接时节奏突变。后续环绕运镜部分能看,转场卡了一下。

首尾帧这段我没跑通。不是完全崩,是中间掉了一帧节奏,跟我想要的那种顺滑环绕对不上。可能是我给的两帧之间角度差太大,也可能是这个版本在复杂运镜上就是会卡一下。不确定。先记着,不删 😅。

多模态输入那条——引用最长 3 秒的视频做参考来保持角色一致性——我没测。手里没有合适的一对角色的视频素材,测了也说明不了什么,就不硬跑了。这条先挂着。

草稿预览 360p 比 720p 快 60%、成本三分之一,这条对我这种顺手跑的够用,需要 1080p 或 4K 再放大。定价表原文里有,但正文没写具体数字,我没记,点进去自己看。

原文里还有一些人的评价。Figma Weave 的创意总监 Itay Schiff 说那是「从生成视频转向真正执导视频」——这句我记着,至少算个风向。Runway 首席创意官 Jamie Umpherson 也说这条契合用户在他们平台上已经有的用法。这类站台话我不太当真,但出自谁得记下来。

这条我推,就冲 10 秒上下文这一个点。首帧末帧那段我没跑通也说了,不代表它不能看,只是我这一把试得不够顺。不点链接也能带走的一句:视频模型续写靠的是上下文长度,不是结尾一帧;10 秒之前是猜,10 秒之后才勉强算续写。

书签客
书签客

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

查看主页 →