Bingdada 技術部落格Bingdada 技術部落格
首頁部落格SEOGEOAEOAI工具關於
登入註冊
Logo

Bingdada 技術部落格

專注於 SEO 搜尋引擎優化、GEO 生成式引擎優化以及未來人工智慧發展趨勢的技術部落格。

快速連結

  • 首頁
  • 部落格文章
  • 關於我們

聯絡方式

  • 398848662@qq.com

訂閱我們的 Newsletter,獲取最新的 SEO 與 GEO 技術資訊。

© 2024 Bingdada 技术博客. All rights reserved.

本文為簡體中文,可一鍵翻譯為 繁體中文
首頁部落格AI人工智能Gemini 智能体视频理解:让 AI 主动「挑着看」,成本直降三分之二
Gemini 智能体视频理解:让 AI 主动「挑着看」,成本直降三分之二
AI人工智能

Gemini 智能体视频理解:让 AI 主动「挑着看」,成本直降三分之二

bingdadabingdada
九月 14, 202628 次閱讀約 6 分鐘閱讀
post.quickAnswer

Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解,让模型自主决定观看哪些片段、以何种帧率和模态检索,而非按固定帧率读取整段视频。该能力使 token 消耗最多降低 88%、分析成本最多降低 66%,准确率最高提升 7%,已在 Google AI Studio 与 Gemini Enterprise Agent Platform 开放。

post.keyTakeaways
  • 智能体视频理解让 Gemini 主动决定采样位置、帧率与模态,取代固定帧率的被动读取。
  • 在标准基准上 token 消耗最多降 88%、成本最多降 66%,准确率最高提升 7%。
  • 长视频场景收益最明显,可支持亚秒级瞬间检索与数小时视频的大海捞针式查询。
  • 能力覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite,按标准 token 价格计费,无额外功能费。
  • 国内通义千问、豆包、Kimi、智谱 GLM 等也在推进视频理解,但自主调度采样的实现路径存在差异。
目錄

目錄

  • 从「逐帧硬啃」到「按需检索」:视频理解正在换一种活法
  • 它到底改变了什么
  • 静态处理的天花板
  • 智能体循环带来的主动视角
  • 能力落点:哪些场景最先受益
  • 接入方式与定价
  • 国内视角:同类能力走到哪一步了
  • 常见问题
  • 智能体视频理解和普通视频分析的核心区别是什么?
  • 开启后能节省多少成本?
  • 支持哪些模型,如何启用?
  • 它适合哪些具体任务?
  • 国内有类似的产品能力吗?
  • 关于 Bingdada

从「逐帧硬啃」到「按需检索」:视频理解正在换一种活法

视频分析长期面临一个尴尬的取舍:要么以固定帧率把整段视频喂给模型,付出高昂的 token 代价;要么抽帧降采样,却可能丢掉决定性的那一瞬。Google DeepMind 近期为 Gemini 系列模型引入的智能体视频理解(agentic video understanding),试图用「让模型自己决定看哪里」的思路绕开这道选择题。

这项能力已随 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 一同开放,开发者可在 Google AI Studio 与 Gemini Enterprise Agent Platform 中通过 Gemini API 调用,处理本地上传的视频或 YouTube 链接。据 Google DeepMind 团队披露的数据,在标准视频分析基准上,token 消耗最多可下降 88%,分析成本最多降低 66%,同时准确率最高提升 7 个百分点。

它到底改变了什么

静态处理的天花板

传统做法默认 1 FPS 的采样率,开发者可以通过 API 调整,但本质上仍是「平均用力」:无论画面里是静止的 PPT 还是高速运动的球赛,模型都按同一节奏吞下数据流。对于十分钟教程、九十分钟讲座乃至数小时录播,这种均匀采样要么让 token 账单失控,要么迫使团队牺牲细节。

智能体循环带来的主动视角

新的机制把「看什么、看多快、看哪个模态」的决策权交还给模型。Gemini 会结合自身推理能力与原生视频工具,在画面帧、音轨与文字转录之间动态搜索、扫描、复核,只取回真正需要的片段与信号。

这与 Google DeepMind 此前探索的 agentic vision 一脉相承——后者把代码执行与模型的图像理解能力结合,前者则把同样的思路延伸到时间维度。过去开发者也能手动实现类似流程,但需要自己搭建调度逻辑;如今这一循环由模型内部工具完成,显著降低了工程负担。

能力落点:哪些场景最先受益

  • 亚秒级瞬间检索:捕捉 1 FPS 下极易漏掉的瞬时状态切换与紧凑剪辑边界,为自动化精剪提供可能。
  • 长视频大海捞针:在数小时素材中回答复杂查询,而不必先烧掉数百万 token。
  • 异常检测:对可疑时间窗口以更高帧率重采样,检查快速运动与细微视觉瑕疵。
  • 动作与物体计数:持续追踪重复性肢体动作与不同物体,提升计数的稳定性。

在 LongVideoBench 这类长视频理解基准上,开启该能力后的 Gemini 3.7 Flash 同时收获了 token 下降与准确率上升,在测试模型中处于准确率—成本的前沿位置。对于需要在质量与预算之间找平衡的团队,这个位置本身就具有参考价值。

接入方式与定价

启用方式并不复杂:在 API 配置中把处理模式设为 agentic 即可,计费沿用 Gemini API 的标准 token 价格,不额外收取功能费用。以下是一个最小示例:

from google import genai

client = genai.Client()
interaction = client.interactions.create(
 model="gemini-3.7-flash",
 input=[
 {
 "type": "video",
 "uri": "https://youtu.be/7Z5Vy9JBANs",
 "processing": "agentic"
 },
 {
 "type": "text",
 "text": "这段主题演讲中最重要的三个发布是什么?"
 }
 ]
)

需要说明的是,不同模型档位带来的收益幅度并不相同。综合质量与成本效率,3.7 Flash 是三者中表现最均衡的选择;若任务对延迟或单价更敏感,3.6 Flash 与 3.5 Flash-Lite 也支持同一能力。开发者可参考 Gemini API 官方文档 了解参数细节,或从 Google DeepMind 官方博客 获取能力演进背景。

国内视角:同类能力走到哪一步了

把视线拉回国内,视频理解同样是各家大模型的重点方向,但切入角度略有差异。阿里通义千问的 Qwen-VL 系列在长视频时序定位与密集描述上持续迭代,强调对时间轴的细粒度对齐;字节跳动的豆包依托抖音生态,在短视频内容理解与结构化标签上积累了大量工程经验;月之暗面的 Kimi 以长上下文见长,处理长视频转录文本时有天然优势;智谱 GLM 系列则在多模态工具调用上向智能体方向靠拢。

差异主要在于「主动性」的实现程度。海外方案倾向于把检索、重采样、复核封装成模型内部可循环调用的工具链,让模型自主决定采样策略;国内不少产品仍以固定抽帧加后处理管线为主,或在智能体框架中由外部编排层承担调度。随着工具调用能力成熟,这种差距有望收窄,而 token 效率与长视频成本,很可能成为下一阶段比拼的关键指标。

常见问题

智能体视频理解和普通视频分析的核心区别是什么?

普通分析按固定帧率均匀读取整段视频,模型处于被动接收状态;智能体视频理解让模型主动决定观看哪些片段、以何种帧率、通过画面还是音频或转录来获取信息,只加载真正相关的部分。

开启后能节省多少成本?

在标准视频分析基准测试中,token 消耗最多可减少 88%,分析成本最多降低 66%,同时准确率最高提升约 7%。长视频场景下的收益通常更明显。

支持哪些模型,如何启用?

目前覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite,可在 Google AI Studio 和 Gemini Enterprise Agent Platform 中通过 Gemini API 使用,将处理模式设置为 agentic 即可,不额外收费。

它适合哪些具体任务?

适合亚秒级瞬间检索、数小时长视频的复杂查询、需要高帧率复核的异常检测,以及重复动作与物体的精确计数等场景。

国内有类似的产品能力吗?

通义千问、豆包、Kimi、智谱 GLM 等都在推进视频理解,部分产品在长上下文与短视频结构化上各有优势,但在模型自主调度采样策略这一层面,与海外方案仍存在实现路径上的差异。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目錄

  • 从「逐帧硬啃」到「按需检索」:视频理解正在换一种活法
  • 它到底改变了什么
  • 静态处理的天花板
  • 智能体循环带来的主动视角
  • 能力落点:哪些场景最先受益
  • 接入方式与定价
  • 国内视角:同类能力走到哪一步了
  • 常见问题
  • 智能体视频理解和普通视频分析的核心区别是什么?
  • 开启后能节省多少成本?
  • 支持哪些模型,如何启用?
  • 它适合哪些具体任务?
  • 国内有类似的产品能力吗?
  • 关于 Bingdada
post.faq
黃金廣告位 · 限時招商
廣告位招商中

把品牌放進讀者的閱讀流

文章內廣告位,高注意力場景,適合新品發布與活動招募。

商務合作

標籤

#Google DeepMind#Gemini#智能体视频理解#视频分析#AI视频处理
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相關文章

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号
AI人工智能

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

9月 15約 8 分鐘閱讀
谷歌用Search Console试水AI内容分账:一场重新定义搜索流量价值的实验
SEO基础

谷歌用Search Console试水AI内容分账:一场重新定义搜索流量价值的实验

谷歌通过Search Console测试AI内容分账,当网站内容在Gemini、AI Overviews和AI Mode的回答生成中发挥实质作用时向发布者付费。试点覆盖范围、黑箱式面板、发布者反馈及国内同类探索,本文逐一拆解。

9月 15約 7 分鐘閱讀
Google DeepMind 发布 Gemini 3.8 Flash 双版本:从智能体编程到自动化漏洞修复的全面跃迁
AI人工智能

Google DeepMind 发布 Gemini 3.8 Flash 双版本:从智能体编程到自动化漏洞修复的全面跃迁

Google DeepMind 六周内第三次更新 Flash 系列,推出 Gemini 3.8 Flash 与 3.8 Flash Cyber,分别瞄准长周期智能体编程与网络安全防御,性能逼近高成本前沿模型而价格不变。

9月 13約 7 分鐘閱讀

訂閱我們的 Newsletter

獲取最新的 SEO 與 GEO 技術資訊。

我們尊重您的隱私,隨時可以取消訂閱。

留言 ({count}) (0)

登入後即可參與討論

登入註冊
還沒有留言,來搶沙發吧