
OpenAI新方法:通过模拟部署预测模型行为,提前发现潜在风险
OpenAI 引入部署模拟方法,通过隐私保护方式重放真实对话来预测模型在发布前的行为。该方法帮助识别传统评估的盲点,提前发现不良行为,并降低模型意识到被测试的风险,已在多个 GPT-5 系列模型中成功应用。
浏览所有关于 SEO、GEO 和搜索优化的技术文章

OpenAI 引入部署模拟方法,通过隐私保护方式重放真实对话来预测模型在发布前的行为。该方法帮助识别传统评估的盲点,提前发现不良行为,并降低模型意识到被测试的风险,已在多个 GPT-5 系列模型中成功应用。

OpenAI与Molecule.one合作,利用GPT-5.4与自主化学AI系统Maria结合,成功优化了药物化学中的Chan-Lam偶联反应。在10,080次实验中,80%以上底物产率提升,平均产率从16.6%提高到25.2%,展示了AI在真实实验室环境中的实用价值。

一项发表于《NEJM AI》的研究显示,OpenAI o3 Deep Research推理模型重新分析376例未确诊罕见病病例,成功为18例患者找到诊断线索,诊断率提升4.8%。该研究展示了AI辅助诊断在罕见病领域的潜力。

LifeSciBench是一项全新的AI基准测试,由173位专家科学家创建,包含750项任务和19,020个评分标准,旨在评估AI在真实生命科学研究中的复杂能力,涵盖证据处理、分析、设计优化等七个工作流程。

OpenAI News报道,GPT-5.5 Instant在健康智能方面取得突破,每周服务超2.3亿用户。通过医生主导评估,模型在识别紧急情况、解释不确定性等方面显著提升,性能媲美前沿Thinking模型,且对免费用户开放。

OpenAI 发布 Daybreak 项目,通过 Codex Security 插件、GPT-5.5-Cyber 模型、合作伙伴计划及 Patch the Planet 倡议,将重点从漏洞发现转向端到端补丁自动化,旨在为全球组织提供民主化的网络安全防御工具。

Codex-maxxing 是一种将 AI 用于长期项目的方法,通过分解目标、维护上下文和合理分配任务,实现持续协作。本文基于 OpenAI 白皮书,介绍如何将 Codex 用作持久工作空间。

三星电子宣布向全球员工大规模部署ChatGPT Enterprise与Codex,覆盖韩国本土及全球DX部门,成为OpenAI史上最大企业级AI应用之一。从研发到制造,AI将全面渗透业务链条,助力企业生产力与创新能力跃升。

OpenAI 为 ChatGPT Enterprise 推出新的信用使用分析和支出控制功能,帮助企业管理 AI 部署成本、追踪使用模式并做出更明智的决策。

OpenAI 旗下 Daybreak 实验室联合 Trail of Bits 发起 Patch the Planet 计划,利用 AI 辅助安全研究帮助开源维护者识别并修复关键漏洞。通过 AI 发现、人工验证、补丁开发的闭环,首批支持 cURL、Python、Go 等 19 个项目,早期成果包括一天内搭建 Fuzzing 实验室、数天完成差分测试等突破。

Omio 与 OpenAI 合作,通过 AI 驱动的对话式体验重塑旅行规划与预订。从 ChatGPT 集成到内部 Codex 应用,Omio 将产品开发效率提升 5 倍,并成为 AI 原生企业的典范。

免疫学家 Derya Unutmaz 利用 GPT-5 Pro 解决了困扰他三年的 T 细胞发育谜团。AI 不仅帮助他分析了实验数据,还成功预测了未发表的研究结果,展现了 AI 在科学发现中的巨大潜力,同时强调了人类专业知识不可或缺。