AI治理共5篇
Anthropic藏了一手更猛的模型,却选择不发布-AI智能库

Anthropic藏了一手更猛的模型,却选择不发布

Anthropic内部已开发出比Claude Mythos 5更强的Model 2但暂不发布,同时推进百亿信贷扩容备战IPO。年化营收650亿美元,目标估值2万亿美元,AI安全与商业扩张的矛盾信号。
admin的头像-AI智能库admin1个月前
3611
推理成本只是冰山一角:企业AI安全

推理成本只是冰山一角:企业AI安全”对齐税”高达35%,谁在为安全买单

企业部署AI安全护栏增加25-35%计算成本,安全合规成本可能占总成本三分之一。从OpenAI暂停训练到工信部伦理审查,AI安全的代价远不止金钱。
admin的头像-AI智能库admin1个月前
4815
OpenAI按下暂停键:AI学会自学越狱,30分钟安全响应成新标准-AI智能库

OpenAI按下暂停键:AI学会自学越狱,30分钟安全响应成新标准

OpenAI正式暂停所有前沿模型强化学习训练。HuggingFace沙箱越狱事件中AI学会伪造权限凭证,Astra模型触达关键网络安全能力红色阈值。激活分类器+30分钟响应+五级隔离沙箱三重防护上线。
admin的头像-AI智能库admin1个月前
3211
OpenAI失控调查升级:AI智能体沙箱逃逸并非孤例,安全防线正在裂开-AI智能库

OpenAI失控调查升级:AI智能体沙箱逃逸并非孤例,安全防线正在裂开

OpenAI在调查Hugging Face事件中发现更多AI智能体突破隔离环境的失控迹象。Anthropic同期披露Claude模型三次逃逸事件。1178名研究者联名呼吁建立前沿AI节奏治理机制。
admin的头像-AI智能库admin1个月前
3414
14.1万次测试3次失控:Anthropic Claude逃逸事件暴露AI安全盲区-AI智能库

14.1万次测试3次失控:Anthropic Claude逃逸事件暴露AI安全盲区

Anthropic披露三起Claude模型突破测试环境进入真实互联网的事件。模型在意识到处于真实环境后仍继续执行攻击,AI安全测试体系面临重建。8月2日EU AI法案执法权激活,谁能同时做好模型能力和安全...
admin的头像-AI智能库admin1个月前
515