
Datadog 利用 OpenAI 的 Codex 智能体进行系统级代码审查,成功在 22% 的历史事故回放中识别出被人类审查员遗漏的关键风险。这不仅提升了代码审查质量,更从根本上改变了工程团队对可靠性的认知,将 AI 从辅助工具转变为预防事故的核心系统,让工程师能聚焦于架构与设计。
在当今的云计算时代,系统可靠性是企业生存的基石。对于 Datadog 这样运营着全球最广泛使用的可观测性平台的公司而言,帮助客户监控、排障并保护复杂的分布式系统是其核心使命。当系统出现故障时,客户依赖 Datadog 快速定位问题。这意味着,在代码进入生产环境之前,可靠性就必须被内建到开发流程的每一个环节。
对于 Datadog 的工程团队来说,代码审查因此成为一个高风险、高价值的时刻。它不仅仅是发现语法错误或逻辑漏洞,更深层次的目标是理解每一次代码变更如何在相互关联的系统中产生涟漪效应。这正是传统的静态分析和基于规则的工具常常力不从心的地方。
为了应对这一挑战,Datadog 的 AI 开发体验团队将目光投向了 OpenAI 的 Codex。这个 AI 编程智能体能够将系统级的推理能力融入代码审查,揭示人类难以在大规模代码库中发现的潜在风险。
“节省时间固然重要且真实,”Datadog AI DevX 团队负责人 Brad Carter 表示,“但对我们这种规模的公司而言,预防事故的发生远比节省时间更具说服力。”
在引入 Codex 之前,Datadog 的高效代码审查严重依赖资深工程师。这些专家需要深刻理解代码库的历史、架构权衡以及各组件间的依赖关系,才能识别出系统性的风险。然而,这种深度的上下文知识难以规模化。早期的 AI 代码审查工具并未解决这个核心问题;它们更像高级的语法检查器,只能标记出表面问题,却忽略了更广泛的系统细微差别。Datadog 的工程师们常常觉得这些工具的反馈过于浅显或充满噪音,因此选择忽略。
OpenAI News 显示,Datadog 开始试点 Codex 的方式是将其直接集成到实时的开发工作流中。在公司最大、使用最频繁的一个代码仓库里,每一个拉取请求都会自动由 Codex 进行审查。工程师们通过点赞或踩来反馈 Codex 的评论,并在团队间分享非正式的使用体验。许多人注意到,与之前那些产生噪音或浅薄建议的工具不同,Codex 的反馈值得认真阅读。
为了测试 AI 辅助审查是否真的能超越风格检查的范畴,Datadog 构建了一个事故回放框架。
团队没有使用假设场景,而是回溯了历史上的真实事故。他们重建了那些导致事故的拉取请求,然后让 Codex 像参与原始审查一样对每个请求进行分析。最后,他们请那些事故的责任工程师来评估:如果当时收到了 Codex 的反馈,结果是否会不同?
结果令人瞩目:Codex 发现了超过 10 个案例,约占 Datadog 所检查事故的 22%,在这些案例中,工程师确认 Codex 提供的反馈本可以避免事故的发生。这一表现超过了团队评估的任何其他工具。
关键点在于,这些拉取请求已经通过了当时的人工代码审查。回放测试表明,Codex 发现了审查员当时未能识别的风险,它补充了人类判断,而非取代。
Datadog 的分析显示,Codex 能够持续标记那些仅凭代码差异本身难以察觉、且无法被确定性规则捕获的问题。工程师们不再将 Codex 的评论视为“机器人噪音”:
“对我而言,Codex 的评论感觉就像是我共事过的最聪明的工程师,而且他有无限的时间来寻找 bug。它能看到我大脑无法同时容纳的关联。”—— Brad Carter, Datadog 工程经理
这种将审查反馈与真实可靠性结果联系起来的能力,是 Codex 在 Datadog 评估中脱颖而出的关键。与静态分析工具不同,Codex 会比较拉取请求的意图与提交的代码变更,在整个代码库和依赖关系的上下文中进行推理,甚至执行代码和测试来验证行为。
“它是第一个真正在程序的更大上下文中考虑代码差异的工具,”Carter 说,“这既新颖又令人大开眼界。”
对于许多工程师来说,这种转变彻底改变了他们参与 AI 审查的方式。Datadog 的高级软件工程师 Ted Wexler 分享道:“我开始像对待真正的代码审查反馈一样对待 Codex 的评论。不是那种我会扫一眼就忽略的东西,而是值得认真关注的内容。”
经过评估后,Datadog 在更广泛的工程团队中部署了 Codex。如今,超过 1000 名工程师 定期使用它。反馈主要通过非正式渠道涌现,而非正式的工具内指标。工程师们在 Slack 上分享 Codex 带来的深刻见解、建设性评论,以及它如何帮助他们换个角度思考问题。
虽然时间节省是显著的,但团队一致指出,更重要的转变在于工作方式本身。“Codex 改变了我对代码审查应该是什么的看法。它不是为了复制我们最优秀的人类审查员。而是为了发现人类在孤立审查变更时难以看到的关键缺陷和边界情况。”—— Brad Carter, Datadog 工程经理
对于 Datadog 而言,Codex 带来的更广泛影响是重新定义了代码审查本身。团队不再将审查仅仅视为捕捉错误或优化周期时间的检查点,而是将 Codex 视为一个核心的可靠性系统,一个可靠的合作伙伴:
这种转变与 Datadog 领导层对工程优先级的定义高度一致:可靠性和客户信任与开发速度同等重要,甚至更为重要。“我们是可观测性公司,我们的产品必须可靠。Codex 帮助我们从根本上将可靠性内建到开发流程中,而不是事后补救,”Carter 总结道。
Datadog 与 OpenAI Codex 的合作案例,为业界展示了 AI 在软件开发中的巨大潜力。它不仅仅是代码补全或 bug 修复的助手,更是能够理解复杂系统、辅助人类进行高价值判断的工程伙伴。通过将系统级上下文引入代码审查,Codex 帮助 Datadog 将预防事故的能力提升到了一个新的水平,让工程师的宝贵时间得以聚焦在更具创造性和战略性的设计工作上。这或许预示着未来软件开发中,人机协作的新范式。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。