Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能当 AI 开始验收自己的代码:Cognition 用 GPT‑6 Astra 重塑软件测试与审查流程
当 AI 开始验收自己的代码:Cognition 用 GPT‑6 Astra 重塑软件测试与审查流程
AI人工智能

当 AI 开始验收自己的代码:Cognition 用 GPT‑6 Astra 重塑软件测试与审查流程

bingdadabingdada
九月 14, 2026103 次阅读约 6 分钟阅读
快速回答

Cognition 将 GPT‑6 Astra 用于 Devin,使其能自行运行软件、录制运行过程并生成测试报告,从而减少工程师逐行审查代码的负担,并加快客户缺陷响应速度。

核心要点
  • GPT‑6 Astra 的核心提升在于让 Devin 能测试并证明其产出按预期运行。
  • Devin 测试 Otter Run 游戏时返回模拟器录屏与标注通过项、未覆盖区域的报告。
  • 客户提交缺陷截图后,Devin 可修复并回传结果截图,显著加快响应。
  • Cognition 的目标是让工程师减少人工查看代码,把精力转向评估证据与更高价值判断。
  • 国内厂商在测试生成与代码推理上已有布局,但端到端证据链方案仍在演进。
目录

目录

  • 从「写完就交」到「自证可用」:AI 编程工具的下一个分水岭
  • Devin 如何用 Astra 完成「自测自证」
  • 为什么「少看代码」反而可能意味着交付更多
  • 国内视角:自测自证能力正在成为国产编程智能体的共同方向
  • 对工程团队的现实启示
  • 常见问题
  • GPT‑6 Astra 在 Cognition 的产品中主要解决什么问题?
  • Devin 测试 Otter Run 游戏时输出了什么?
  • 这套能力如何加快客户支持响应?
  • 国内厂商在同类方向上进展如何?
  • 工程团队评估 AI 编程代理时应关注哪些指标?
  • 关于 Bingdada

从「写完就交」到「自证可用」:AI 编程工具的下一个分水岭

过去两年,AI 编程助手的主战场集中在「生成代码」的速度与准确率上。但真正在一线交付软件的团队都清楚:写出代码只是起点,验证它能按预期运行、并留下可追溯的证据,才是决定交付节奏的关键环节。Cognition 公司——也就是自主软件工程师 Devin 的打造者——正在尝试用 OpenAI 的 GPT‑6 Astra 补上这块短板:让 Devin 不只是写代码,还能自己跑测试、录证据、交报告。

这一变化的意义在于,它把 AI 编程工具的价值主张从「帮你写」推进到「帮你证明它能跑」。Cognition 联合创始人 Walden Yan 将 Astra 的核心提升概括为测试与验证能力——不只是生成代码,而是让系统能够展示其产出确实按预期运作。

Devin 如何用 Astra 完成「自测自证」

Cognition 并没有把 GPT‑6 Astra 局限在单一产品线中。按照 Yan 的说法,Astra 已被用于改进包括 Devin 核心云端代理、命令行工具以及桌面端产品在内的多个环节。这意味着测试与验证能力被嵌入到从云到端的完整工作流,而不是某个孤立功能。

一个具体案例颇具代表性:Devin 借助 Astra 测试一款名为 Otter Run 的 iPhone 游戏。它最终返回的不只是一句「测试通过」,而是两样东西——一段在模拟器中运行游戏的录屏,以及一份标注了哪些检查项通过、哪些区域尚未覆盖的报告。录屏呈现应用的真实行为,报告则界定测试的范围与边界。工程师据此既能观察软件实际表现,也能清楚知道还有哪些盲区需要人工介入。

这种「证据式交付」同样改变了客户支持的处理方式。当客户发来一张缺陷截图,团队可以把它交给由 Astra 驱动的 Devin,由后者修复问题,并回传一张显示修复结果的截图。Yan 表示,这让团队响应客户的速度「快得多」——因为沟通的载体从文字描述变成了可视化的前后对比。

为什么「少看代码」反而可能意味着交付更多

Cognition 对这套能力的期待,最终落在代码审查环节的效率上。传统审查高度依赖工程师逐行阅读 diff,判断改动是否安全、是否符合预期。而当 Devin 能够自行测试并附上结果证据时,审查者可以把注意力从「逐行核对」转向「评估证据是否充分」。

Yan 的判断是,随着时间推移,团队需要人工查看的代码会越来越少,而最终交付的产出会更多。这并非降低标准,而是把人工精力重新分配到更高价值的判断上。对于希望了解 OpenAI 官方动态的读者,可以参考 OpenAI 官网 获取产品与研究的原始信息;关于自主代理在软件工程中的定位,Wikipedia 上关于软件测试 的条目也提供了基础框架。

国内视角:自测自证能力正在成为国产编程智能体的共同方向

把视线拉回国内,类似的思路已经在多家厂商的产品中显现。阿里的通义千问系列在代码生成之外,持续强化单元测试生成与缺陷定位能力;字节跳动的豆包与火山引擎体系也在探索让智能体在沙箱中运行代码并回传执行结果;DeepSeek 凭借较强的代码推理能力,被大量开发者用于补全与调试场景;月之暗面的 Kimi 则在长上下文理解上支持跨文件的代码审查类任务。

差异同样明显。海外产品更强调「端到端证据链」——录屏、报告、截图形成闭环,并与云端代理深度绑定;国内产品目前更多停留在「生成测试用例」或「解释报错」的单点能力上,把测试执行、结果可视化与审查流程打通的完整方案仍在演进。对于国内团队而言,真正的门槛可能不在模型本身,而在于如何把沙箱执行、产物留存与团队协作工具链整合起来。

对工程团队的现实启示

如果你的团队正在引入 AI 编程代理,可以从三个层面评估其成熟度:它能否独立执行测试、能否留下可复核的证据、以及这些证据能否直接进入现有的审查流程。只回答第一个问题的工具,仍然只是一个更快的代码生成器;能同时回答后两个问题的工具,才可能真正改变交付节奏。

常见问题

GPT‑6 Astra 在 Cognition 的产品中主要解决什么问题?

它主要提升 Devin 的测试与验证能力,让 Devin 能自行运行软件、录制运行过程并生成测试报告,从而减少工程师逐行审查代码的负担。

Devin 测试 Otter Run 游戏时输出了什么?

它返回了一段在模拟器中运行游戏的录屏,以及一份标明通过项与未覆盖区域的报告,两者结合用于证明软件行为并界定测试范围。

这套能力如何加快客户支持响应?

客户提交缺陷截图后,团队可交由 Astra 驱动的 Devin 修复,并回传显示修复结果的截图,用可视化对比替代冗长的文字沟通。

国内厂商在同类方向上进展如何?

通义千问、豆包、DeepSeek、Kimi 等已在测试生成、代码推理与长上下文审查上有所布局,但把测试执行、证据留存与审查流程打通的端到端方案仍在完善中。

工程团队评估 AI 编程代理时应关注哪些指标?

重点看三点:能否独立执行测试、能否留下可复核的证据、以及证据能否直接接入现有审查流程。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目录

  • 从「写完就交」到「自证可用」:AI 编程工具的下一个分水岭
  • Devin 如何用 Astra 完成「自测自证」
  • 为什么「少看代码」反而可能意味着交付更多
  • 国内视角:自测自证能力正在成为国产编程智能体的共同方向
  • 对工程团队的现实启示
  • 常见问题
  • GPT‑6 Astra 在 Cognition 的产品中主要解决什么问题?
  • Devin 测试 Otter Run 游戏时输出了什么?
  • 这套能力如何加快客户支持响应?
  • 国内厂商在同类方向上进展如何?
  • 工程团队评估 AI 编程代理时应关注哪些指标?
  • 关于 Bingdada
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#GPT‑6 Astra#Devin#Cognition#AI 代码审查
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

OpenAI 模型驱动的 Fyxer:AI 行政助理如何做到 90 天留存率 90%
AI人工智能

OpenAI 模型驱动的 Fyxer:AI 行政助理如何做到 90 天留存率 90%

Fyxer 将 OpenAI 模型与 50 万小时行政助理工作流数据结合,用 30-50 个专用模型拆解邮件处理,并通过用户编辑反馈持续优化,实现 90 天留存率 90%、53% 草稿被原样采纳。

9月 15约 7 分钟阅读
从Perplexity的实践看GPT-6 Astra:AI如何接管端到端系统工程
AI人工智能

从Perplexity的实践看GPT-6 Astra:AI如何接管端到端系统工程

Perplexity将GPT-6 Astra嵌入工程链路,用于撰写沟通文案、修改线上系统、监控生产软件,并让模型自建测试程序模拟外部服务。检查频率大幅降低的背后,是AI从辅助工具向系统托管者的角色跃迁。

9月 13约 6 分钟阅读
OpenAI 存储平台 Habitat 如何支撑十亿级 ChatGPT 用户:从 Python 库到分布式系统的三年演进
AI人工智能

OpenAI 存储平台 Habitat 如何支撑十亿级 ChatGPT 用户:从 Python 库到分布式系统的三年演进

OpenAI 的在线存储平台 Habitat 从 Python 客户端库演变为每秒处理 7000 万次请求的分布式系统,支撑每周超 10 亿用户。本文拆解其架构演进逻辑、Python 技术选型的代价,以及国内厂商的平行竞赛。

9月 12约 7 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧