Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客国产 AI 前线当多模态AI走进交易链路:ECCV 2026 上的智能体商业命题与产业解法
当多模态AI走进交易链路:ECCV 2026 上的智能体商业命题与产业解法
国产 AI 前线

当多模态AI走进交易链路:ECCV 2026 上的智能体商业命题与产业解法

bingdadabingdada
九月 11, 202632 次阅读约 8 分钟阅读
快速回答

ECCV 2026 的 MARS2 Workshop 将智能体商业带入计算机视觉顶会,挑战赛显示多模态 AI 在广告整体理解上可达 86.67 分,但营销意图推理仅 63.53 分。实验表明,补充跨模态音频证据时间线可提升定位精度 16.7 分,比扩大参数量更有效。

核心要点
  • ECCV 2026 的 MARS2 Workshop 是本届唯一由中国科技公司牵头举办的 Agentic Commerce 方向 Workshop。
  • MARS2 挑战赛三条赛道成绩落差明显:整体理解 86.67 分,关键时刻定位 62.27 分,营销意图推理 63.53 分。
  • 音频证据时间线使 VTG 赛道定位精度提高 16.7 分,而参数量从 4B 扩展到 8B 反而下降 0.2 分。
  • 冠军方案采用 Proposer-Critic 双模型验证与从粗到细的两阶段定位,核心是让 AI 拿着证据回答问题。
  • 钛动科技通过钛极大模型与 Navos 多智能体平台,将多模态能力嵌入真实营销流程并验证商业结果。
目录

目录

  • 从视觉识别到商业决策:顶会议程正在转向
  • 多模态AI的能力边界:看懂内容容易,理解意图难
  • 一条反常识的优化路径:对齐比堆参数更有效
  • 国内视角:智能体商业的另一种推进方式
  • 从技术闭环到学术开放:产业问题如何反哺研究
  • 常见问题
  • MARS2 Workshop 是什么?
  • MARS2 挑战赛考察什么能力?
  • 为什么音频证据时间线比增加参数量更有效?
  • 钛动科技在智能体商业方向有哪些积累?
  • 技术公司为什么越来越多地在顶会办 Workshop?
  • 关于 Bingdada

从视觉识别到商业决策:顶会议程正在转向

计算机视觉顶会历来是模型精度与算法创新的竞技场,但在 ECCV 2026 的议程表上,一个更贴近真实交易场景的议题被推到了聚光灯下——Agentic Commerce(智能体商业)。

这场在瑞典马尔默举行的大会,由欧洲计算机视觉协会主办,Google、Meta、Apple、Amazon 等科技巨头作为主要赞助商参与。真正引发讨论的,是一个名为 MARS2 的 Workshop,全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》。根据 ECCV 官网公开信息,这是本届大会全部 Workshop 中,唯一一个由中国科技公司牵头举办的 Agentic Commerce 方向 Workshop。

牵头方是钛动科技。这家公司近十年在跨境营销场景中处理广告视频、用户行为与投放策略,如今把产业中积累的问题带到了学术社区面前。

多模态AI的能力边界:看懂内容容易,理解意图难

MARS2 Workshop 的嘉宾阵容包括牛津大学教授 Yarin Gal(现代贝叶斯深度学习代表学者,领导 OATML 实验室)、MIT 助理教授 Paul Pu Liang(研究多感官智能与跨模态理解)、伦敦玛丽女王大学的 Shanxin Yuan(数字人与运动智能方向)以及林雪平大学的 Fahad Shahbaz Khan(视觉识别与视觉语言模型方向)。

这些研究者共同指向一个判断:多模态 AI 的下一步,不是「看见一段视频、说出几句描述」,而是能在复杂、动态、跨模态信息中找到证据,理解事件如何发生、意图如何形成,并把判断转化为可靠行动。

这一判断在配套挑战赛 MARS2 2026 Challenge 中得到了量化验证。赛事使用基于钛动真实商业场景构建的 M-CAR 数据集,包含 3108 支广告视频、覆盖 30 多种语言,总计 36.5 小时视频被拆分为 18198 个语义片段,平均约 7 秒一个独立片段。

三条赛道的结果呈现出明显的能力落差:

  • MAC(整体理解)赛道最高分 86.67
  • VTG(关键时刻定位)赛道最高分 62.27
  • MDC(营销意图推理)赛道最高分 63.53

从整体理解到精准定位与策略推理,冠军方案成绩相差 20 多分。这说明模型看懂广告大致内容并不困难,但一旦需要跨越多个片段、梳理时序关系、追溯前因后果并作出商业判断,表现就会明显下滑。这正是从「System 1」感知走向「System 2」推理的距离。

一条反常识的优化路径:对齐比堆参数更有效

当业界普遍将提升模型能力等同于增加参数时,本次赛事的消融实验给出了不同答案。

VTG 赛道有团队为模型补充了一条跨模态「音频证据时间线」,将人声、音乐和其他声音发生的时间标注出来,再与画面逐一对齐,模型定位精度直接提高了 16.7 分。相比之下,参数量从 4B 扩展到 8B 反而下降了 0.2 分。

这对产业界的提示很直接:算力有限时,与其急于更换更大的模型,不如先让模型「听全、看全」,再把信息对准。冠军方案中反复出现的 Proposer-Critic 双模型验证、从粗到细的两阶段定位、按视频时长灵活分配视觉 Token 等思路,核心逻辑可以概括为一句话——让 AI 拿着证据回答问题。

竞赛技术报告将这套思路称为「证据链工程」。它提醒业界,模型规模固然重要,但进入商业流程后,信息如何组织、不同模态如何对齐、推理链路是否可靠,同样决定 AI 能否真正干活。

值得注意的是,赛事对模型规模设置了硬限制:MAC 和 MDC 赛道模型不超过 14B,VTG 不超过 8B,且只能使用开源权重。这迫使参赛者在有限体量内打磨数据处理与推理方法,而非依赖巨型闭源模型硬压分数。最终,字节跳动背景的团队 The Boys 在 MAC 和 MDC 两条赛道拿下冠军,并在 VTG 赛道获得亚军。

国内视角:智能体商业的另一种推进方式

在海外,ChatGPT Ads 等产品正在探索对话式广告与智能体交易;在国内,同类方向的推进呈现出不同节奏。

文心一言、通义千问、DeepSeek、豆包、Kimi、智谱 GLM 等基础模型在中文语义理解与多模态能力上持续迭代,但将模型能力嵌入真实交易链路、形成可验证商业闭环的案例,更多出现在垂直行业服务商一侧。钛动科技自研的钛极(Tec-Chi)系列模型即是其中一例:2026 年 1 月,Tec-Chi-Think-1.0-32B 以 85.82 分登顶广告营销专业大模型测评榜 SuperCLUE-Mkt;约半年后,Tec-Chi-VL-1.0-27B 在 SuperCLUE-AdsVU 出海营销视频理解测评中以 86.43 分获得总榜第二。

这类垂直模型的路径与通用大模型形成互补:通用模型提供基础理解与推理能力,垂直模型则在特定商业场景中完成证据对齐与意图判断。

从技术闭环到学术开放:产业问题如何反哺研究

钛动科技将 MARS2 定位为「产学研连接器」。其业务基础来自覆盖全球 200 多个国家和地区、服务 10 万+ 品牌出海、累计管理 4 亿+ 条广告策略的实践。这些真实反馈被沉淀为模型可调用的营销知识,再通过 Workshop 开放给全球研究者,优胜方案与评测基准向社区公开。

招股书数据显示,2025 年前三季度,钛动 AI 营销解决方案收入达 1.16 亿美元,同比增长 68.5%,占总收入 89.5%,同期净收入留存率 132.5%。在 ChatGPT Ads 首批广告主定向邀请测试中,某出海品牌经其 AI 技术团队优化后,ROI 提升至原来的 2.5 倍。

技术公司在顶会中的角色变化也值得关注。从 CVPR 2025 的 Embodied AI Workshop(NVIDIA、Meta、Apple、Microsoft、Adobe、Amazon 等参与组织)到 Waymo Open Dataset Challenge,垂直赛道头部企业正从「交卷的人」变为「出题的人」。AI 越往真实世界走,最难的问题越容易出现在产业一线,而 Workshop 成为产业问题与学术方法碰撞的合适场所。

MARS2 指向的方向是清晰的:多模态 AI 的下一阶段,比的不是能否看懂图片和视频,而是能否在不同语言、文化和商业目标交织的环境里,真正解决问题。

常见问题

MARS2 Workshop 是什么?

MARS2 是 ECCV 2026 期间举办的 Workshop,全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》,聚焦多模态推理与智能体商业(Agentic Commerce)。根据 ECCV 官网信息,它是本届大会唯一由中国科技公司牵头举办的该方向 Workshop,牵头方为钛动科技。

MARS2 挑战赛考察什么能力?

挑战赛基于 M-CAR 数据集,要求 AI 完成三层任务:看懂整条广告视频、在长视频中定位关键时刻、理解背后的营销意图。三条赛道 MAC、VTG、MDC 分别对应这三层能力,模型规模被限制在 14B 或 8B 以内,且只能使用开源权重。

为什么音频证据时间线比增加参数量更有效?

VTG 赛道实验显示,补充跨模态音频证据时间线使定位精度提高 16.7 分,而参数量从 4B 扩展到 8B 反而下降 0.2 分。这说明在算力有限时,让模型「听全、看全」并对齐多模态信息,比单纯扩大模型规模更能提升商业场景中的实际表现。

钛动科技在智能体商业方向有哪些积累?

钛动科技自 2017 年起服务企业出海,覆盖全球 200 多个国家和地区、服务 10 万+ 品牌,累计管理 4 亿+ 条广告策略。其自研钛极(Tec-Chi)系列模型在 SuperCLUE-Mkt 和 SuperCLUE-AdsVU 测评中取得领先成绩,营销多智能体平台 Navos 则将模型能力嵌入市场洞察、内容生产、广告投放与效果优化流程。

技术公司为什么越来越多地在顶会办 Workshop?

AI 越深入真实世界,最难的问题越先出现在产业一线。企业最先碰到问题、急需答案,研究者则需要真实场景验证新方法。Workshop 成为双方对接的场所,企业从「交卷的人」变为「出题的人」,研究成果再回流产业接受验证。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目录

  • 从视觉识别到商业决策:顶会议程正在转向
  • 多模态AI的能力边界:看懂内容容易,理解意图难
  • 一条反常识的优化路径:对齐比堆参数更有效
  • 国内视角:智能体商业的另一种推进方式
  • 从技术闭环到学术开放:产业问题如何反哺研究
  • 常见问题
  • MARS2 Workshop 是什么?
  • MARS2 挑战赛考察什么能力?
  • 为什么音频证据时间线比增加参数量更有效?
  • 钛动科技在智能体商业方向有哪些积累?
  • 技术公司为什么越来越多地在顶会办 Workshop?
  • 关于 Bingdada
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#多模态AI#量子位 QbitAI#智能体商业#ECCV 2026#MARS2 Workshop#钛动科技
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态
国产 AI 前线

从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态

蚂蚁灵波联合魔搭社区、阿里云天池发起首届具身大模型挑战赛,以 LingBot-VLA 2.0 开源基座为核心,设置仿真初赛与上海真机黑客松决赛,面向全球开发者开放。

9月 15约 6 分钟阅读
国产算力破局新思路:预制化集装箱与超智融合系统如何重塑算力供给
国产 AI 前线

国产算力破局新思路:预制化集装箱与超智融合系统如何重塑算力供给

太初元碁以集装箱预制化交付与超智融合系统入选“算力中国·年度卓越成就”,为国产算力缺口提供分布式破局思路。

9月 13约 8 分钟阅读
当银行把审批权交给AI:4200万小微经营者的融资体验正在被重写
国产 AI 前线

当银行把审批权交给AI:4200万小微经营者的融资体验正在被重写

网商银行在外滩大会披露AI银行落地进展:前台百灵2.0面向4200万小微商家开放,后台八大AI工作台覆盖风控、人审、营销、产研。从一句话提额到40万融资方案,AI Agent正在重写小微金融的服务逻辑。

9月 12约 14 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧