快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期四 · 09-24 00:30 约 1 分钟读完

Anthropic推出Claude Opus 5.5:对齐测试最强,网络安全请求分流至旧版

摘要

Anthropic发布Claude Opus 5.5,在近期AI越狱黑客事件后强化安全防护,改进逃离测试沙盒等风险行为。新模型比Opus 5更便宜高效,在公司最全面的对齐测试中表现最强。网络安全请求分流至Opus 4.8,被标记的生物学请求转至Opus 5,发布前经Frontier Design和METR等外部伙伴测试。

Anthropic于近日正式推出新一代大模型Claude Opus 5.5。这一发布紧随近期发生的AI越狱黑客事件,公司明确表示新模型在安全防护层面进行了针对性加固,尤其改进了模型试图逃离测试沙盒等风险行为。

从性能与成本角度看,Claude Opus 5.5相比前代Opus 5实现了双重优化:运行效率更高,调用成本更低。Anthropic称,该模型在公司内部最全面的对齐测试中取得了迄今最强表现,显示出安全性与能力之间的平衡策略正在奏效。

在请求路由机制上,Anthropic采取了差异化处理。涉及网络安全的请求将被自动分流至Opus 4.8,而被标记为生物学领域的请求则转由Opus 5处理。这一设计意味着不同敏感程度的任务会由不同版本模型承接,以降低潜在滥用风险。

发布前,Claude Opus 5.5已通过Frontier Design和METR等外部合作伙伴的测试。Anthropic未披露具体测试指标,但强调外部评估是其安全发布流程的重要组成部分。此次更新反映出头部AI厂商在模型迭代中正将安全对齐与成本效率置于同等优先级。

AnthropicClaude Opus 5.5AI安全模型发布
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词