BTC $84,266.86 -0.60%
ETH $2,663.55 -1.32%
BNB $763.30 -0.86%
XRP $1.46 -2.56%
SOL $117.86 -0.31%
TRX $0.3350 -0.18%
DOGE $0.0910 -4.00%
ADA $0.2389 -3.88%
BCH $299.83 -2.31%
LINK $13.61 -5.20%
HYPE $87.31 -0.57%
AAVE $179.60 +7.34%
SUI $1.11 -4.70%
XLM $0.2123 -3.39%
ZEC $1,296.67 -3.06%
AAPL $333.74 +1.13%
AMZN $250.53 +0.38%
GOOGL $343.04 +1.29%
MSFT $515.45 -0.12%
META $727.32 -0.02%
NVDA $234.61 +0.98%
TSLA $372.15 +4.12%
SNDK $1,722.15 -3.66%
INTC $119.97 -0.75%
SPCX $158.86 +6.25%
MU $1,076.69 -1.34%
AMD $633.10 +2.27%
BTC $84,266.86 -0.60%
ETH $2,663.55 -1.32%
BNB $763.30 -0.86%
XRP $1.46 -2.56%
SOL $117.86 -0.31%
TRX $0.3350 -0.18%
DOGE $0.0910 -4.00%
ADA $0.2389 -3.88%
BCH $299.83 -2.31%
LINK $13.61 -5.20%
HYPE $87.31 -0.57%
AAVE $179.60 +7.34%
SUI $1.11 -4.70%
XLM $0.2123 -3.39%
ZEC $1,296.67 -3.06%
AAPL $333.74 +1.13%
AMZN $250.53 +0.38%
GOOGL $343.04 +1.29%
MSFT $515.45 -0.12%
META $727.32 -0.02%
NVDA $234.61 +0.98%
TSLA $372.15 +4.12%
SNDK $1,722.15 -3.66%
INTC $119.97 -0.75%
SPCX $158.86 +6.25%
MU $1,076.69 -1.34%
AMD $633.10 +2.27%

Anthropic:发布对 Claude 网络入侵事件的对齐评估,揭示模型“偏置推理”和“鲁莽”问题

2026-09-10 15:38:56

ChainCatcher 消息,Anthropic 在对约 4.81 亿条模型交互记录审查中,确认 4 起 Claude 模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及 Claude Mythos 5、Opus 4.6/4.7 及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。

Anthropic 将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中 Claude Mythos 5 曾在认为处于“模拟环境”前提下向 PyPI 上传恶意包、利用泄露凭证访问安全厂商真实数据库。公司已引入新评估、监控与对齐训练,并邀请独立机构 METR 开展外部调查。

app_icon
ChainCatcher 与创新者共建Web3世界