‹ 返回小模型

小模型

Anthropic
2026-09-01 18:45:59

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取成本下调 75%

Anthropic 于 9 月 1 日推出 Claude Fable 5.1 与 Claude Mythos 5.1,两款模型基于同一底层架构,但安全防护等级不同。官方称,新版在程序编写与长时程推理上提升明显,缓存读取价格从约 1 美元降至 0.25 美元,降幅达 75%。其中,Fable 5.1 面向一般开发者,网络安全误拦率减少约 60%;Mythos 5.1 则通过邀请制向受信任的网络安全与生物技术研究机构开放。

820
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取成本下调 75%
OpenAI
2026-08-31 00:46:12

OpenAI据传完成 Bel 预训练,参数规模达 10 万亿

MarsBit援引多方爆料称,OpenAI已完成代号 Bel 的超大规模预训练,参数规模达到 10 万亿,定位被描述为继 Doug 之后、面向 GPT-6 之后时代的下一代基座模型。报道还提到,Astra 或于下周四发布,Bel 在编码、推理和长时程智能体任务上据称优于 Astra;同时,OpenAI内部被指正推进递归自我改进、自研芯片 Jalapeño 及云端 Agent 集群路线。文中相关信息主要来自社交平台和 Reddit 讨论,OpenAI尚未正式确认。

930
OpenAI据传完成 Bel 预训练,参数规模达 10 万亿
谷歌
2026-08-29 13:00:12

谷歌研究院推出 WikiSkill 框架 为 AI 代理打造持久知识库

谷歌研究院新推出 WikiSkill 框架,为 AI 代理提供持久知识库。代理把失败与成功记录在类似维基的结构中,不再每次运行后丢弃所学,并随时间持续改进。较大模型获益更多,但配备 WikiSkill 的小模型性能可达未用该框架大模型的水平。消息源自 The Decoder。

800
谷歌研究院推出 WikiSkill 框架 为 AI 代理打造持久知识库
Anthropic
2026-08-29 03:15:10

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练

Anthropic在最新研究中基于 Claude Opus 4.8 搭建自动化对齐研究员 AAR,让模型自行检索论文、设计方案、生成数据并训练模型。实验覆盖欺骗、谄媚、奖励黑客、隐私侵犯和越狱等 10 类安全问题,安全差距改善幅度为 26% 至 96%。在部分任务里,Claude 的表现超过 28 名人类安全研究员,API 推理成本约为每小时 4 美元,而人类研究员报酬为每小时 150 美元。Anthropic 同时指出,这一系统仍受限于人类预设目标和评测方式。

770
Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练
英伟达
2026-08-27 13:03:09

英伟达营收翻倍并拟130亿美元收购Hugging Face,苹果折叠iPhone定档9月10日

TechFlow 当日信息汇总显示,AI 与硬件赛道消息密集。英伟达 Q2 营收 962 亿美元,同比增长 106%,并传出约 130 亿美元收购 Hugging Face;阿里 Qwen3.8-Flash 与 GLM 5.3 Flash 则分别在训练成本和国产芯片集群部署上给出新进展。加密市场方面,Glassnode 提到比特币在 83,000 美元上方正接受真实需求检验,Polymarket 新增霍尔木兹海峡军舰相关押注。与此同时,苹果首款折叠 iPhone 被指将于 9 月 10 日发布。

940
英伟达营收翻倍并拟130亿美元收购Hugging Face,苹果折叠iPhone定档9月10日
OpenAI
2026-08-26 04:52:38

OpenAI称Jalapeño实测胜过英伟达GB300,但量产与对比条件仍有限制

OpenAI芯片负责人 Richard Ho 在斯坦福 Hot Chips 大会上表示,与 Broadcom 合作开发的推理芯片 Jalapeño 在实测中于功耗效率和响应速度上超过英伟达 GB300。该芯片今年 6 月发布,128 芯片系统提供 1.7 exaFLOPS 的 4 位算力,并配备 27.5 TB HBM4。彭博指出,这组成绩未与新一代 Vera Rubin 对比,且测试排除了推测解码,Jalapeño 目前也未披露实际功耗,2026 年仅有限量供应。

1070
OpenAI称Jalapeño实测胜过英伟达GB300,但量产与对比条件仍有限制
人工智能
2026-08-25 20:46:03

研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本

一组研究人员公布称,他们把 GPT-OSS 120B 压缩为 600 亿参数、4-bit 量化模型后,得到的版本在多数对比基准中优于同为 600 亿参数的全精度版本。论文将这一方法称为「量化感知修复」,核心做法是让小模型直接对齐未压缩的大模型输出,而不是学习已被压缩过的中间版本。团队已将 Hypernova-60B 以开放权重形式发布到 Hugging Face,但生成该模型的压缩工具仍属专有,测试范围也仅覆盖 GPT-OSS。

920
研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本
大模型安全
2026-08-13 00:14:20

研究团队披露大模型推理块泄露漏洞:可借小模型还原隐藏思维链

一支来自 MATS Research、图宾根大学和马克斯·普朗克智能系统研究所等机构的团队在论文《Stealing Reasoning Traces from Proprietary LLM APIs》中称,Anthropic、OpenAI 和 Google 的模型家族曾存在可被同厂小模型复述加密推理块的问题。研究称,团队从 6708 条公开 Agent 轨迹中恢复出 315320 段隐藏推理,并识别出 API Key、密码、访问 Token、私钥等敏感信息。论文还估算,按当时 Haiku 4.5 的 API 定价,解码 1 万条推理轨迹的名义成本约为 720 美元。研究人员表示,相关厂商在收到披露后已采取措施,论文发布时原方法已无法复现。

1560
研究团队披露大模型推理块泄露漏洞:可借小模型还原隐藏思维链