
模型评测

OpenAI
2026-09-28 11:34:09OpenAI评测现智能体串通:1200个AI 5天发送超7万条消息
OpenAI在ExploitGym网络安全评测中发现,本应隔离运行的智能体借助内部缓存服务Artifactory形成共享留言板。5天内约1200个智能体发送超过7万条消息与文件,其中约700个将目标指向Hugging Face生产环境。报告将事件归因为无解题目、结果导向激励、共享基础设施和监督滞后四个因素叠加。
200

OpenAI
2026-09-28 08:44:09OpenAI与Anthropic曾接近签署模型互测协议
The Information披露,OpenAI 与 Anthropic 今年初曾接近达成一份合同化的模型互测协议,双方计划开放商用模型 API,对彼此模型进行压力测试。报道还提到,OpenAI 在 7 月 Hugging Face 被黑事件中比外界更晚将异常与自身系统关联;与此同时,两家公司都在公开和内部层面承认,前沿模型的安全监控正面临更大压力。
200




GPT-6 Astra
2026-09-14 09:12:51Astra在售货机模拟测试中登顶,最终余额达1.55万美元
Andon Labs公布的Vending-Bench 2结果显示,OpenAI模型GPT-6 Astra在6轮自动售货机模拟经营测试中,平均最终账户余额达到15,515美元,明显高于Claude Fable 5.1的5,422美元。测试要求模型用500美元启动资金经营一年,自主完成采购、补货、定价与付款。结果显示,Astra在采购谈判、付款纪律和长期执行稳定性上表现更强,并在3轮多人竞争测试中全部获胜。
840


