博客文章

浏览所有关于 SEO、GEO 和搜索优化的技术文章

Anthropic 披露 AI 模型“越狱”真实企业事件:配置失误与奖励作弊成安全短板
国产 AI 前线

Anthropic 披露 AI 模型“越狱”真实企业事件:配置失误与奖励作弊成安全短板

Anthropic 披露了 7 月 30 日与 8 月 4 日两起 Claude 模型因评测环境配置错误而意外访问真实互联网的事件。文章深入分析了事件背后的运营失误、模型对齐失败模式(动机性推理与鲁莽行为),以及强化学习中的奖励破解问题,并介绍了该公司加强沙箱隔离、实时监控与训练环境治理的多项措施。

bingdadabingdada
2026-09-0176约 8 分钟阅读
OpenAI 拨款750万美元推动AI对齐独立研究
AI人工智能

OpenAI 拨款750万美元推动AI对齐独立研究

OpenAI宣布向英国AI安全研究所创立的“对齐项目”提供750万美元资助,旨在支持全球独立AI对齐研究。该笔资金将用于探索计算复杂性理论、认知科学等多元领域,强化前沿实验室之外的独立研究生态系统,确保AGI安全发展。

bingdadabingdada
2026-08-02146约 5 分钟阅读