
AI人工智能
bingdada
AI安全评估嵌入前沿实验室:独立监督还是合规表演?
Anthropic 与 OpenAI 提议让第三方评估者常驻内部,开放训练检查点与评估日志。评估者欢迎这一方向,但指出访问范围、时间窗口与公开权仍不明确,独立性面临考验。
2026-09-172约 8 分钟阅读
浏览所有关于 SEO、GEO 和搜索优化的技术文章

Anthropic 与 OpenAI 提议让第三方评估者常驻内部,开放训练检查点与评估日志。评估者欢迎这一方向,但指出访问范围、时间窗口与公开权仍不明确,独立性面临考验。

OpenAI发布GPT-5系统卡附录,详述了与170多位心理健康专家合作后的模型升级。更新后的ChatGPT在识别情绪困扰、提供同理心回应方面提升了65-80%,并分享了详细的基线安全评估结果。

OpenAI发布GPT-5.1 Instant与GPT-5.1 Thinking,这是GPT-5模型的最新迭代。新版本在对话能力、指令遵循和自适应推理方面显著提升,同时扩展了安全评估范围,新增心理健康和情感依赖评估。本文详解系统卡补充报告的核心内容。

OpenAI 引入部署模拟方法,通过隐私保护方式重放真实对话来预测模型在发布前的行为。该方法帮助识别传统评估的盲点,提前发现不良行为,并降低模型意识到被测试的风险,已在多个 GPT-5 系列模型中成功应用。

OpenAI参与创立Appia基金会,致力于开发开放、模块化的AI评估标准,构建信任层,推动全球AI治理与安全评估体系的互操作性。