研究团队将 AI 模型缩至 600 亿参数后性能反超同级版本
一组研究人员公布称,他们把 GPT-OSS 120B 压缩为 600 亿参数、4-bit 量化模型后,得到的版本在多数对比基准中优于同为 600 亿参数的全精度版本。论文将这一方法称为「量化感知修复」,核心做法是让小模型直接对齐未压缩的大模型输出,而不是学习已被压缩过的中间版本。团队已将 Hypernova-60B 以开放权重形式发布到 Hugging Face,但生成该模型的压缩工具仍属专有,测试范围也仅覆盖 GPT-OSS。

一组研究人员公布称,他们把 GPT-OSS 120B 压缩为 600 亿参数、4-bit 量化模型后,得到的版本在多数对比基准中优于同为 600 亿参数的全精度版本。论文将这一方法称为「量化感知修复」,核心做法是让小模型直接对齐未压缩的大模型输出,而不是学习已被压缩过的中间版本。团队已将 Hypernova-60B 以开放权重形式发布到 Hugging Face,但生成该模型的压缩工具仍属专有,测试范围也仅覆盖 GPT-OSS。

Citrini 分析师 Jukan 表示,OpenAI 自研 AI 芯片「Jalapeño」在扩展规模上可能难以达到英伟达 Rubin 平台的水平。其判断依据是,若 HBM4 高带宽内存完全依赖三星供应,产能爬坡会存在上限。Jukan 还称,OpenAI 若想继续扩大部署规模,可能需要放宽 HBM4 传输速度等规格要求,以便引入其他供应商产品,缓解供应链限制。

英伟达推出Nemotron 3 Super,这是一款1200亿总参数开源混合模型,单次前向仅激活127亿参数,瞄准AI代理场景下的推理吞吐与成本问题。

AISLE用3.6B开源模型复现Anthropic Mythos旗舰漏洞检测,每百万token仅0.11美元。测试显示AI安全能力呈锯齿状边界,小模型在某些子任务上反超大模型,护城河在系统架构。

英伟达推出开源AI模型Nemotron 3 Super,总参数达1200亿,但单次前向仅激活127亿,主打降低智能体工作负载推理成本,并称在特定场景下吞吐量最高较Qwen3.5-122B提升7.5倍。

英伟达发布Nemotron 3 Super,120B参数MoE开源模型,激活仅12.7B参数,实现7.5倍吞吐提升,支持1M上下文,专为AI Agent优化,完全开放许可。

英伟达正式推出Nemotron 3 Super,一款1200亿参数的开源混合模型(MoE),每次前向推理仅激活12.7B参数,在智能体任务中吞吐量较Qwen3.5-122B提升7.5倍,支持百万级Token上下文,完全开源。

AI安全公司AISLE测试显示,DeepSeek R1在关键漏洞检测中与Anthropic的Mythos表现持平,甚至更便宜的模型也能发现相同漏洞。测试揭示了FreeBSD和OpenBSD中潜伏17年和27年的严重缺陷。结果表明AI安全性能更依赖工作流整合,而非模型成本,对加密市场有深远影响。
