
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解,让模型自主决定观看哪些片段、以何种帧率和模态检索,而非按固定帧率读取整段视频。该能力使 token 消耗最多降低 88%、分析成本最多降低 66%,准确率最高提升 7%,已在 Google AI Studio 与 Gemini Enterprise Agent Platform 开放。
视频分析长期面临一个尴尬的取舍:要么以固定帧率把整段视频喂给模型,付出高昂的 token 代价;要么抽帧降采样,却可能丢掉决定性的那一瞬。Google DeepMind 近期为 Gemini 系列模型引入的智能体视频理解(agentic video understanding),试图用「让模型自己决定看哪里」的思路绕开这道选择题。
这项能力已随 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 一同开放,开发者可在 Google AI Studio 与 Gemini Enterprise Agent Platform 中通过 Gemini API 调用,处理本地上传的视频或 YouTube 链接。据 Google DeepMind 团队披露的数据,在标准视频分析基准上,token 消耗最多可下降 88%,分析成本最多降低 66%,同时准确率最高提升 7 个百分点。
传统做法默认 1 FPS 的采样率,开发者可以通过 API 调整,但本质上仍是「平均用力」:无论画面里是静止的 PPT 还是高速运动的球赛,模型都按同一节奏吞下数据流。对于十分钟教程、九十分钟讲座乃至数小时录播,这种均匀采样要么让 token 账单失控,要么迫使团队牺牲细节。
新的机制把「看什么、看多快、看哪个模态」的决策权交还给模型。Gemini 会结合自身推理能力与原生视频工具,在画面帧、音轨与文字转录之间动态搜索、扫描、复核,只取回真正需要的片段与信号。
这与 Google DeepMind 此前探索的 agentic vision 一脉相承——后者把代码执行与模型的图像理解能力结合,前者则把同样的思路延伸到时间维度。过去开发者也能手动实现类似流程,但需要自己搭建调度逻辑;如今这一循环由模型内部工具完成,显著降低了工程负担。
在 LongVideoBench 这类长视频理解基准上,开启该能力后的 Gemini 3.7 Flash 同时收获了 token 下降与准确率上升,在测试模型中处于准确率—成本的前沿位置。对于需要在质量与预算之间找平衡的团队,这个位置本身就具有参考价值。
启用方式并不复杂:在 API 配置中把处理模式设为 agentic 即可,计费沿用 Gemini API 的标准 token 价格,不额外收取功能费用。以下是一个最小示例:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "这段主题演讲中最重要的三个发布是什么?"
}
]
)
需要说明的是,不同模型档位带来的收益幅度并不相同。综合质量与成本效率,3.7 Flash 是三者中表现最均衡的选择;若任务对延迟或单价更敏感,3.6 Flash 与 3.5 Flash-Lite 也支持同一能力。开发者可参考 Gemini API 官方文档 了解参数细节,或从 Google DeepMind 官方博客 获取能力演进背景。
把视线拉回国内,视频理解同样是各家大模型的重点方向,但切入角度略有差异。阿里通义千问的 Qwen-VL 系列在长视频时序定位与密集描述上持续迭代,强调对时间轴的细粒度对齐;字节跳动的豆包依托抖音生态,在短视频内容理解与结构化标签上积累了大量工程经验;月之暗面的 Kimi 以长上下文见长,处理长视频转录文本时有天然优势;智谱 GLM 系列则在多模态工具调用上向智能体方向靠拢。
差异主要在于「主动性」的实现程度。海外方案倾向于把检索、重采样、复核封装成模型内部可循环调用的工具链,让模型自主决定采样策略;国内不少产品仍以固定抽帧加后处理管线为主,或在智能体框架中由外部编排层承担调度。随着工具调用能力成熟,这种差距有望收窄,而 token 效率与长视频成本,很可能成为下一阶段比拼的关键指标。
普通分析按固定帧率均匀读取整段视频,模型处于被动接收状态;智能体视频理解让模型主动决定观看哪些片段、以何种帧率、通过画面还是音频或转录来获取信息,只加载真正相关的部分。
在标准视频分析基准测试中,token 消耗最多可减少 88%,分析成本最多降低 66%,同时准确率最高提升约 7%。长视频场景下的收益通常更明显。
目前覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite,可在 Google AI Studio 和 Gemini Enterprise Agent Platform 中通过 Gemini API 使用,将处理模式设置为 agentic 即可,不额外收费。
适合亚秒级瞬间检索、数小时长视频的复杂查询、需要高帧率复核的异常检测,以及重复动作与物体的精确计数等场景。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Поместите бренд в ленту читателя
Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

谷歌通过Search Console测试AI内容分账,当网站内容在Gemini、AI Overviews和AI Mode的回答生成中发挥实质作用时向发布者付费。试点覆盖范围、黑箱式面板、发布者反馈及国内同类探索,本文逐一拆解。

Google DeepMind 六周内第三次更新 Flash 系列,推出 Gemini 3.8 Flash 与 3.8 Flash Cyber,分别瞄准长周期智能体编程与网络安全防御,性能逼近高成本前沿模型而价格不变。
Получайте свежие материалы по SEO и GEO.
Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.
Войдите, чтобы присоединиться к обсуждению