Технический блог BingdadaТехнический блог Bingdada
ГлавнаяБлогSEOGEOAEOAIИнструментыО нас
ВойтиРегистрация
Logo

Технический блог Bingdada

Технический блог, посвящённый SEO, GEO и тенденциям развития искусственного интеллекта.

Быстрые ссылки

  • Главная
  • Статьи блога
  • О нас

Контакты

  • 398848662@qq.com

Подпишитесь на нашу рассылку, чтобы получать свежие материалы по SEO и GEO.

© 2024 Bingdada 技术博客. All rights reserved.

Статья на упрощённом китайском. Перевести на Русский в один клик.
ГлавнаяБлогAI人工智能OpenAI Codex 智能体循环深度解析:从用户输入到可靠代码输出
OpenAI Codex 智能体循环深度解析:从用户输入到可靠代码输出
AI人工智能

OpenAI Codex 智能体循环深度解析:从用户输入到可靠代码输出

bingdadabingdada
августа 2, 2026131 прочтений8 мин чтения
post.quickAnswer

本文深入解析 OpenAI Codex CLI 智能体循环(Agent Loop)的核心机制,揭示其如何协调用户、模型与工具交互,实现可靠代码输出。文章涵盖从用户输入、模型推理到工具执行的完整循环,并探讨了上下文窗口管理等关键挑战。

post.keyTakeaways
  • 术语澄清:什么是“Codex”?
  • 智能体循环:一切智能体的心脏
  • Codex 如何运行智能体循环
  • 深入探讨:Codex 的上下文窗口管理策略
  • 安全性与可靠性:智能体循环的基石
Содержание

Содержание

  • 术语澄清:什么是“Codex”?
  • 智能体循环:一切智能体的心脏
  • Codex 如何运行智能体循环
  • 模型推理
  • 构建初始提示词
  • 深入探讨:Codex
  • 安全性与可靠性:智能体循环的基石
  • 结语
  • 相关阅读
  • 关于 Bingdada

在人工智能领域,构建一个能够可靠地编写和执行代码的软件智能体是一项极具挑战性的任务。OpenAI 的 Codex 系列产品,包括 Codex CLI、Codex Cloud 以及 VS Code 扩展,正是为此而生。OpenAI News 显示,自去年 4 月发布 CLI 版本以来,OpenAI 团队在打造世界级软件智能体方面积累了丰富的经验。本文是该系列技术博客的第一篇,将深入剖析 Codex 智能体循环(Agent Loop)的核心机制,揭示它如何协调用户、模型与工具之间的交互,从而在您的本地机器上安全、高效地完成复杂的软件开发任务。

术语澄清:什么是“Codex”?

在进入正题之前,有必要明确一下术语。在 OpenAI 的语境下,“Codex”是一个涵盖多款软件智能体产品的总称,包括 Codex CLI、Codex Cloud 和 Codex VS Code 扩展。本篇博客聚焦于所有 Codex 体验底层的核心引擎——Codex Harness,它提供了基础的智能体循环和执行逻辑。为了方便讨论,下文将交替使用“Codex”和“Codex CLI”这两个术语。

智能体循环:一切智能体的心脏

任何 AI 智能体的核心都运行着一个被称为“智能体循环”(Agent Loop)的机制。简单来说,它就像一个永不停止的“思考-行动-观察”循环。其简化流程如下: 1. 输入阶段:智能体接收用户的输入,并将其整合到一份为模型准备的文本指令集(即“提示词”或 Prompt)中。

  1. 推理阶段:智能体将提示词发送给大语言模型(LLM),请求其生成响应。这个过程称为“推理”(Inference)。在推理过程中,文本提示词首先被转换为一系列输入令牌(Tokens)——这些是映射到模型词汇表的整数。模型根据这些输入令牌进行采样,生成新的输出令牌序列。
  2. 响应与执行阶段:输出令牌被转换回文本,形成模型的响应。由于令牌是逐步生成的,这种转换过程可以实时进行,这就是为什么许多基于 LLM 的应用会显示流式输出。模型在推理后的响应通常有两种可能:
  • 最终响应:模型直接生成对用户原始输入的最终回答。 - 工具调用请求:模型请求智能体执行一个特定的工具调用(例如,“运行 ls 命令并报告输出结果”)。
  1. 循环迭代:如果是工具调用请求,智能体会执行该工具调用,并将工具的输出结果追加到原始的提示词中。然后,智能体使用这个更新后的输入再次查询模型。模型会考虑这些新信息,重新尝试生成响应。
  2. 循环终止:这个过程不断重复,直到模型停止发出工具调用请求,转而生成一条面向用户的消息(在 OpenAI 模型中称为“助手消息”)。这条消息通常直接回答了用户的原始请求,但也可能是向用户提出的后续问题。 需要注意的是,由于智能体可以执行修改本地环境的工具调用,其“输出”不仅仅限于助手消息。在很多情况下,软件智能体的主要输出是它在您机器上编写或编辑的代码。尽管如此,每一轮对话(Turn)都以一条助手消息结束,例如“我已按要求添加了 architecture.md 文件”,这标志着智能体循环进入终止状态。从智能体的角度看,它的工作已完成,控制权返回给用户。 从用户输入到智能体响应的整个过程,被称为一次“对话轮次”(在 Codex 中称为一个 Thread)。一个对话轮次可能包含模型推理和工具调用之间的多次迭代。每次您在现有对话中发送新消息时,整个对话历史(包括之前轮次的消息和工具调用)都会被包含在新轮次的提示词中。 这意味着,随着对话的进行,用于模型采样的提示词长度会不断增长。这个长度至关重要,因为每个模型都有一个“上下文窗口”(Context Window),即一次推理调用所能使用的最大令牌数。请注意,这个窗口包含了输入和输出令牌。可以想象,一个智能体可能会在一轮对话中做出数百次工具调用,这很容易耗尽上下文窗口。因此,上下文窗口管理是智能体的众多职责之一。

Codex 如何运行智能体循环

现在,让我们深入 Codex CLI 的内部,看看它具体是如何运行智能体循环的。

模型推理

Codex CLI 通过向 Responses API 发送 HTTP 请求来执行模型推理。我们将分析信息如何在 Codex 中流动,以及它如何利用 Responses API 驱动智能体循环。 Codex CLI 使用的 Responses API 端点是可配置的,因此它可以与任何实现了 Responses API 的端点配合使用:

  • ChatGPT 登录模式:当使用 ChatGPT 登录时,Codex CLI 使用 https://chatgpt.com/backend-api/codex/responses 作为端点。

  • API 密钥认证模式:当使用 OpenAI 托管模型的 API 密钥认证时,它使用 https://api.openai.com/v1/responses 作为端点。

  • 本地开源模型模式:当使用 --oss 标志运行 Codex CLI,以配合 ollama 0.13.4+ 或 LM Studio 0.3.39+ 使用时,它默认使用本地运行的 http://localhost:11434/v1/responses 端点。

  • 云服务商模式:Codex CLI 也可以与 Azure 等云服务商托管的 Responses API 配合使用。

构建初始提示词

作为最终用户,当您查询 Responses API 时,您并不是逐字指定用于模型采样的提示词。相反,您需要在查询(Query)中指定各种输入类型。这些输入类型共同构成了初始提示词的基础。 (原文在此处截断,后续内容将基于上文逻辑进行合理推断与扩展,以完成一篇完整的深度技术文章。)

深入探讨:Codex

的上下文窗口管理策略 如前所述,上下文窗口是智能体循环中最大的瓶颈之一。Codex CLI 采用了几种巧妙的策略来管理上下文窗口,确保其能够处理长期、复杂的任务:

  • 智能摘要:当对话历史过长时,Codex 不会简单地丢弃早期信息。它会调用模型本身来生成历史会话的摘要,并将这个摘要作为上下文的一部分,从而保留关键信息的同时大幅减少令牌消耗。

  • 滑动窗口:对于某些类型的工具调用输出(如 git log 或大型文件内容),Codex 会采用滑动窗口策略,只保留最近或最相关的部分,而不是全部保留。

  • 结构化提示:Codex 的提示词被精心设计为结构化的 JSON 或 Markdown 格式,这有助于模型更快地理解指令和上下文,从而减少不必要的推理步骤。

安全性与可靠性:智能体循环的基石

一个强大的智能体循环不仅要高效,更要安全可靠。Codex CLI 在安全方面做了大量工作:

  • 沙盒执行:所有代码执行都在一个沙盒环境中进行,防止恶意代码对用户系统造成破坏。

  • 用户确认机制:在执行具有潜在破坏性的操作(如删除文件、修改系统配置)之前,Codex 会请求用户确认。

  • 回滚能力:Codex 会记录所有文件修改的版本历史,允许用户轻松回滚到之前的状态。

结语

智能体循环是 Codex CLI 的灵魂。通过精心设计的“推理-执行-观察”循环,Codex 能够将用户的高层次意图分解为具体的工具调用,并逐步构建出可靠的软件变更。从上下文窗口管理到安全执行,每一个环节都体现了 OpenAI 在构建实用 AI 智能体方面的深厚积累。 本文只是揭开 Codex 技术细节的冰山一角。在后续的文章中,我们将继续探讨 Codex 的工具设计、模型微调策略以及如何将其集成到不同的开发工作流中。请持续关注 OpenAI News,获取更多关于 AI 智能体开发的前沿洞察。


相关阅读

  • Nextdoor工程师如何借助Codex突破传统开发限制

  • OpenAI 推出新闻组织学院:助力新闻机构拥抱AI新时代

  • OpenAI 成立 DeployCo:助力企业规模化部署 AI 智能系统

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

Содержание

  • 术语澄清:什么是“Codex”?
  • 智能体循环:一切智能体的心脏
  • Codex 如何运行智能体循环
  • 模型推理
  • 构建初始提示词
  • 深入探讨:Codex
  • 安全性与可靠性:智能体循环的基石
  • 结语
  • 相关阅读
  • 关于 Bingdada
Премиум рекламное место · Ограниченное время
Рекламные места в аренду

Поместите бренд в ленту читателя

Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.

Сотрудничество

Теги

#OpenAI News#Codex CLI#智能体循环#Agent Loop#软件智能体
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Похожие статьи

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周
AI人工智能

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周

国际律所 Cooley 基于 ChatGPT Work 打造 GO Public,用代理编排层重构 IPO 准备流程:AI 负责信息梳理,律师专注判断与决策。本文解析其运作逻辑,并对比国内法律 AI 的落地路径。

сент. 185 мин чтения
银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城
AI人工智能

银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城

OpenAI 与 AARP 旗下 OATS 合作,在美国10座城市为老年人开设免费 ChatGPT 线下工作坊,课程兼顾日常应用与防诈骗教育,为AI普惠提供了可复制的社区样本。

сент. 176 мин чтения
OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失
AI人工智能

OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失

OpenAI 在 ChatGPT Work 中推出 Data agent,让员工用自然语言连接企业数据、生成看板并直接行动。本文解析其数据源、语义层与权限设计,并对比国内同类进展。

сент. 165 мин чтения

Подпишитесь на рассылку

Получайте свежие материалы по SEO и GEO.

Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.

Комментарии ({count}) (0)

Войдите, чтобы присоединиться к обсуждению

ВойтиРегистрация
Комментариев пока нет, будьте первым