相关资源
沿着原始资料继续读。这里整理模型提供方的报告入口、研究博客和安全评测资料,方便核对具体说法与持续追踪更新。
入口核对日期
OpenAI
从失配报告查阅已披露案例,再通过研究文章、系统卡与披露框架理解方法和范围。
- 案例报告alignment.openai.com
模型失配报告与通告 (在新标签页打开外部网站)
集中查阅 OpenAI 公开的异常或失配行为案例,包括发生环境、观测结果和后续更新;收录不等于确认造成了现实伤害。
- 研究入口alignment.openai.com
对齐研究博客 (在新标签页打开外部网站)
阅读对齐、监督与模型行为相关的研究文章和技术发布,用于理解案例背后的机制、方法与研究局限。
- 系统卡与评测deploymentsafety.openai.com
部署安全与系统卡 (在新标签页打开外部网站)
查阅已部署模型的系统卡、安全评测与防护说明。比较结果时,需要同时检查模型版本、评测条件与启用的防护。
- 披露框架openai.com
模型失配披露框架 (在新标签页打开外部网站)
说明 OpenAI 选择披露哪些行为、如何调查与发布报告,以及披露时仍可能存在的不确定性。它是披露规则,不是事件清单。
Anthropic
对齐研究、模型系统卡与透明度资料分别提供实验方法、评测结果和部署背景。
- 研究入口alignment.anthropic.com
对齐科学博客 (在新标签页打开外部网站)
汇集 Anthropic 对齐研究者的实验、方法与技术文章,涉及奖励投机、行为审计、监督和失配等主题。
- 研究入口www.anthropic.com
对齐研究团队与论文 (在新标签页打开外部网站)
查看对齐团队的研究方向及正式发布的文章,重点包括评测、监督与防护压力测试。
- 系统卡与评测www.anthropic.com
Claude 模型系统卡 (在新标签页打开外部网站)
按模型版本查阅能力、安全评测与部署决策记录;适合追溯某个风险判断对应的模型与测试条件。
- 透明度资料www.anthropic.com
透明度中心 (在新标签页打开外部网站)
提供模型报告、安全与信任流程及公开承诺的汇总入口。这里的概览不能替代完整系统卡和具体调查。