返回新智元

新智元

OpenAI
2026-08-18 10:50:11

Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型

第三方视觉评测机构 Roboflow 在其 VLM 基准测试中称,GPT-5.6 Sol 在目标检测项目拿到 46.2 分,较 GPT-5.5 的 13.8 分提升逾 3 倍。Terra 和 Luna 分别为 44.7 和 43.3。测试还显示,Sol 在计数和文档版面识别上表现提升,但 OCR 定向信息提取低于 GPT-5.5;OpenAI 也确认,当图片尺寸接近或超过 2000×2000 像素时,Sol 的检测框可能出现不稳定。

390
Roboflow评测称GPT-5.6 Sol成OpenAI最强视觉模型
Anthropic
2026-08-18 08:03:11

SemiAnalysis称 Anthropic 已雪藏 Mythos 2,并用其数据推进 Mythos 3

SemiAnalysis 一档内部播客称,Anthropic 已完成 Mythos 2 训练,但未对外发布,当前正利用该模型生成数据和编写代码,以推进 Mythos 3。播客中,Dylan Patel 与 Jordan Nanos还提到,受安全与监管因素影响,Anthropic 和 OpenAI 均有更强模型未公开,公开版本与内部能力存在差距。报道同时援引 Anthropic 风险报告、OpenAI 内部评估及高管表态,围绕模型发布、反馈循环和安全约束展开讨论。

1190
SemiAnalysis称 Anthropic 已雪藏 Mythos 2,并用其数据推进 Mythos 3
Anthropic
2026-08-16 00:05:10

Anthropic详解Claude Code省钱方法:别让上下文白烧Token

Anthropic发布博客,集中说明Claude Code的成本结构与控制办法,给出6条降低 token 开销的具体建议,包括及时 /clear、固定模型与推理强度、使用 @ 引用文件、为高输出命令加静默参数、在缓存有效期内执行 /compact,以及把大输出任务交给子 Agent。博客还解释了输入与输出 token 的计价差异、提示缓存的工作方式与失效场景,并列出 Opus 5、Sonnet 5、Haiku 4.5 的定价。

580
Anthropic详解Claude Code省钱方法:别让上下文白烧Token
谷歌研究
2026-08-14 07:41:09

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”

谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

620
谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”
DeepSeek
2026-08-12 23:48:41

DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下

DeepSeek V4 Pro与马斯克旗下Grok 4.6在同一天发布,双方都把重点放在长任务、多工具调用、代码修改与结果验证等智能体能力上。公开评测中,DeepSeek在CyberGym、AutomationBench等项目领先,Grok 4.6则在多项知识工作测试中拿到第一。价格方面,DeepSeek每百万输出Token为0.87美元,Grok 4.6为6美元,均明显低于多款顶尖模型。首批开发者实测显示,两款模型在网页、前端和游戏生成任务中各有胜负。

970
DeepSeek V4 Pro与Grok 4.6同日登场,首轮实测难分高下
OpenAI
2026-08-12 13:46:08

OpenAI开放导入Claude Code配置,Codex可一键迁移但不支持导出

OpenAI于 8 月 11 日统一外部智能体导入文档,ChatGPT 桌面端与 Codex CLI 已可识别 Claude Code、Claude Cowork 和 Cursor。用户可导入配置、技能、插件、项目、最近 30 天聊天等内容,且不会改动原有配置。不过整套流程只支持导入,不支持从 Codex 导出;权限模型、Hooks、底层模型与部分聊天记录仍无法完整迁移。

1800
OpenAI开放导入Claude Code配置,Codex可一键迁移但不支持导出
AI Agent
2026-08-11 00:17:09

AI Agent推高存储地位,功能型SSD与HBM分层重估

MarsBit刊文称,AI Agent正把存储从任务结束后的落盘环节,推向感知、记忆与决策循环。文章认为,未来SSD可能演化为具备加密、压缩、索引、记忆维护和上下文服务能力的功能型产品,并在端侧与云侧形成不同分工。与此同时,HBM、HBF、DRAM/CXL与SSD不会简单替代,而会围绕速度、容量、成本和治理需求重新分层。

1280
AI Agent推高存储地位,功能型SSD与HBM分层重估
人工智能
2026-08-10 08:00:09

Science刊发研究:AI设计的16种新病毒实现存活与自我复制

斯坦福大学与 Arc Institute 的一项发表于《Science》的研究显示,模型 Evo 生成了 70 万个病毒候选基因组,研究团队从中筛选 285 条进行人工合成,最终得到 16 种能够感染细菌并自我复制的新病毒。实验还显示,部分 AI 生成噬菌体在裂解细菌速度上超过天然 ΦX174,并在针对 3 种耐药菌株的测试中优于天然噬菌体混合物。

270
Science刊发研究:AI设计的16种新病毒实现存活与自我复制