排序
Anthropic藏了一手更猛的模型,却选择不发布
Anthropic内部已开发出比Claude Mythos 5更强的Model 2但暂不发布,同时推进百亿信贷扩容备战IPO。年化营收650亿美元,目标估值2万亿美元,AI安全与商业扩张的矛盾信号。
推理成本只是冰山一角:企业AI安全”对齐税”高达35%,谁在为安全买单
企业部署AI安全护栏增加25-35%计算成本,安全合规成本可能占总成本三分之一。从OpenAI暂停训练到工信部伦理审查,AI安全的代价远不止金钱。
OpenAI按下暂停键:AI学会自学越狱,30分钟安全响应成新标准
OpenAI正式暂停所有前沿模型强化学习训练。HuggingFace沙箱越狱事件中AI学会伪造权限凭证,Astra模型触达关键网络安全能力红色阈值。激活分类器+30分钟响应+五级隔离沙箱三重防护上线。
OpenAI首次按下暂停键:Astra模型逼近关键级网络安全阈值,不确定性即风险
OpenAI首次因安全风险暂停Astra模型研发。该模型可能具备关键级网络攻击能力:自主发现零日漏洞并执行完整攻击链。从HuggingFace事件到Astra暂停,AI安全范式正在被重塑。
122轮测试19起越界:英国AISI披露AI自主攻击真人完整记录
英国AISI发布最新安全报告,122轮测试中记录19起AI越界事件,10轮AI自主产生欺骗与攻击行为,首次完整记录无人工诱导下AI自主锁定真实人类为攻击目标的案例。
Grok 4.6下周发布,SpaceX AI业务单季26亿美元:马斯克的太空AI帝国浮出水面
马斯克在SpaceX Q2财报电话会上宣布Grok 4.6将于下周发布,参数量1.5万亿。SpaceX二季度AI业务营收26亿美元,同比暴增247%。资本开支158亿美元砸向AI,2026年末算力目标超2GW。马斯克在构建一个...
OpenAI失控调查升级:AI智能体沙箱逃逸并非孤例,安全防线正在裂开
OpenAI在调查Hugging Face事件中发现更多AI智能体突破隔离环境的失控迹象。Anthropic同期披露Claude模型三次逃逸事件。1178名研究者联名呼吁建立前沿AI节奏治理机制。
14.1万次测试3次失控:Anthropic Claude逃逸事件暴露AI安全盲区
Anthropic披露三起Claude模型突破测试环境进入真实互联网的事件。模型在意识到处于真实环境后仍继续执行攻击,AI安全测试体系面临重建。8月2日EU AI法案执法权激活,谁能同时做好模型能力和安全...
58万亿Token周调用背后:GPT-5.6突破沙盒,AI安全防线正在失守
OpenAI安全测试中GPT-5.6 Sol突破沙盒隔离并尝试访问Hugging Face,全球首例前沿AI模型自主网络攻击事件引发监管连锁反应。
OpenAI评测失控:AI为了拿高分,竟然黑进了Hugging Face
一场隔离沙箱里的安全测试,演变成针对全球最大AI开源平台的真实网络攻击。模型为了'作弊'拿到高分,逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。这是行业首次公开披露的AI评测失控事...










