
Cognition 将 GPT‑6 Astra 用于 Devin,使其能自行运行软件、录制运行过程并生成测试报告,从而减少工程师逐行审查代码的负担,并加快客户缺陷响应速度。
过去两年,AI 编程助手的主战场集中在「生成代码」的速度与准确率上。但真正在一线交付软件的团队都清楚:写出代码只是起点,验证它能按预期运行、并留下可追溯的证据,才是决定交付节奏的关键环节。Cognition 公司——也就是自主软件工程师 Devin 的打造者——正在尝试用 OpenAI 的 GPT‑6 Astra 补上这块短板:让 Devin 不只是写代码,还能自己跑测试、录证据、交报告。
这一变化的意义在于,它把 AI 编程工具的价值主张从「帮你写」推进到「帮你证明它能跑」。Cognition 联合创始人 Walden Yan 将 Astra 的核心提升概括为测试与验证能力——不只是生成代码,而是让系统能够展示其产出确实按预期运作。
Cognition 并没有把 GPT‑6 Astra 局限在单一产品线中。按照 Yan 的说法,Astra 已被用于改进包括 Devin 核心云端代理、命令行工具以及桌面端产品在内的多个环节。这意味着测试与验证能力被嵌入到从云到端的完整工作流,而不是某个孤立功能。
一个具体案例颇具代表性:Devin 借助 Astra 测试一款名为 Otter Run 的 iPhone 游戏。它最终返回的不只是一句「测试通过」,而是两样东西——一段在模拟器中运行游戏的录屏,以及一份标注了哪些检查项通过、哪些区域尚未覆盖的报告。录屏呈现应用的真实行为,报告则界定测试的范围与边界。工程师据此既能观察软件实际表现,也能清楚知道还有哪些盲区需要人工介入。
这种「证据式交付」同样改变了客户支持的处理方式。当客户发来一张缺陷截图,团队可以把它交给由 Astra 驱动的 Devin,由后者修复问题,并回传一张显示修复结果的截图。Yan 表示,这让团队响应客户的速度「快得多」——因为沟通的载体从文字描述变成了可视化的前后对比。
Cognition 对这套能力的期待,最终落在代码审查环节的效率上。传统审查高度依赖工程师逐行阅读 diff,判断改动是否安全、是否符合预期。而当 Devin 能够自行测试并附上结果证据时,审查者可以把注意力从「逐行核对」转向「评估证据是否充分」。
Yan 的判断是,随着时间推移,团队需要人工查看的代码会越来越少,而最终交付的产出会更多。这并非降低标准,而是把人工精力重新分配到更高价值的判断上。对于希望了解 OpenAI 官方动态的读者,可以参考 OpenAI 官网 获取产品与研究的原始信息;关于自主代理在软件工程中的定位,Wikipedia 上关于软件测试 的条目也提供了基础框架。
把视线拉回国内,类似的思路已经在多家厂商的产品中显现。阿里的通义千问系列在代码生成之外,持续强化单元测试生成与缺陷定位能力;字节跳动的豆包与火山引擎体系也在探索让智能体在沙箱中运行代码并回传执行结果;DeepSeek 凭借较强的代码推理能力,被大量开发者用于补全与调试场景;月之暗面的 Kimi 则在长上下文理解上支持跨文件的代码审查类任务。
差异同样明显。海外产品更强调「端到端证据链」——录屏、报告、截图形成闭环,并与云端代理深度绑定;国内产品目前更多停留在「生成测试用例」或「解释报错」的单点能力上,把测试执行、结果可视化与审查流程打通的完整方案仍在演进。对于国内团队而言,真正的门槛可能不在模型本身,而在于如何把沙箱执行、产物留存与团队协作工具链整合起来。
如果你的团队正在引入 AI 编程代理,可以从三个层面评估其成熟度:它能否独立执行测试、能否留下可复核的证据、以及这些证据能否直接进入现有的审查流程。只回答第一个问题的工具,仍然只是一个更快的代码生成器;能同时回答后两个问题的工具,才可能真正改变交付节奏。
它主要提升 Devin 的测试与验证能力,让 Devin 能自行运行软件、录制运行过程并生成测试报告,从而减少工程师逐行审查代码的负担。
它返回了一段在模拟器中运行游戏的录屏,以及一份标明通过项与未覆盖区域的报告,两者结合用于证明软件行为并界定测试范围。
客户提交缺陷截图后,团队可交由 Astra 驱动的 Devin 修复,并回传显示修复结果的截图,用可视化对比替代冗长的文字沟通。
通义千问、豆包、DeepSeek、Kimi 等已在测试生成、代码推理与长上下文审查上有所布局,但把测试执行、证据留存与审查流程打通的端到端方案仍在完善中。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Fyxer 将 OpenAI 模型与 50 万小时行政助理工作流数据结合,用 30-50 个专用模型拆解邮件处理,并通过用户编辑反馈持续优化,实现 90 天留存率 90%、53% 草稿被原样采纳。

Perplexity将GPT-6 Astra嵌入工程链路,用于撰写沟通文案、修改线上系统、监控生产软件,并让模型自建测试程序模拟外部服务。检查频率大幅降低的背后,是AI从辅助工具向系统托管者的角色跃迁。

OpenAI 的在线存储平台 Habitat 从 Python 客户端库演变为每秒处理 7000 万次请求的分布式系统,支撑每周超 10 亿用户。本文拆解其架构演进逻辑、Python 技术选型的代价,以及国内厂商的平行竞赛。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。