Saturn:主流 AI 回答个人财务问题错误率达 57%
英国金融科技公司 Saturn 发布研究称,主流 AI 模型在个人财务问题上的回答错误率达到 57%。研究覆盖 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型,共测试 121 个问题并生成逾 1 万条答案。多步骤问题错误率升至 88%,免费模型错误率为 63%,表现最好的 Claude Opus 5 在推理模式下仍有 39% 错误率。

英国金融科技公司 Saturn 发布研究称,主流 AI 模型在个人财务问题上的回答错误率达到 57%。研究覆盖 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型,共测试 121 个问题并生成逾 1 万条答案。多步骤问题错误率升至 88%,免费模型错误率为 63%,表现最好的 Claude Opus 5 在推理模式下仍有 39% 错误率。

美国民主党参议员 Elissa Slotkin 在 X 发文称,特朗普可能在即将举行的特朗普—习近平会晤协议中,放宽中国汽车进入美国市场的限制。消息传出后,福特、通用汽车和 Stellantis 周三分别下跌 3.93%、2.37% 和 1.86%。不过,白宫尚未公布相关计划,同期香港上市的比亚迪与吉利也一度走弱,市场对传言真实性仍存疑。

研究团队发布 StudentSim,尝试用真实学生记录训练可评估、可复用的学生模拟器,让 AI tutor 在训练阶段获得更低成本的反馈。该方法围绕行为保真度和指导响应性两项能力展开,并在国际象棋、英语写作和基础数学三类任务中评估 60 位真实学生数据。论文还将 StudentSim 接入 AI tutor 强化学习流程,在国际象棋实验里,使用 StudentSim 作为奖励信号训练出的 tutor 在准确性、指导质量和个性化评分上均排第一。

MarsBit报道称,围绕ChatGPT辅助写作的争议,实质上延续了持续百年的代笔伦理讨论。文章以范德堡大学在校园枪击案后发送安抚邮件并注明由ChatGPT改写辅助完成一事为切口,指出无论是人工代笔还是AI辅助,真正引发反感的并非工具本身,而是署名者是否真实表达了自己的想法。

ABMedia整理的 2026 年 8 月 AI 产业月报显示,Google、xAI、DeepSeek 与 OpenAI 在模型更新上密集出招,开源与匿名模型也同步升温。资金端则集中流向算力、芯片与连接层,英伟达、Anthropic、Stripe 都有大动作。与此同时,AI 安全、伦理与训练数据争议继续扩大,治理节奏仍落后于技术与资本推进速度。

谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

OpenAI 对 ChatGPT 付费与免费体验做出一轮升级:Plus 与 Pro 用户的 GPT-5.6 Sol 事实错误减少 68%,新增可调“推理力度”的滑块;免费版默认模型改为 GPT-5.6 Luna,开放无限次文字对话,并新增 Think 键应对复杂问题。

OpenAI 就苹果商业窃密诉讼公开回应,称苹果在联系记录、离职员工权限与涉案人员行为上存在多项事实错误。OpenAI披露邮件与聊天记录称,苹果律师曾发错邮件、误称有电话沟通,离职员工 Chang Liu 是应苹果员工请求协助定位文件,Tang Tan 则一直明确拒绝接触其他公司的机密信息。OpenAI表示,苹果申请初步禁令既基于虚假信息,也没有必要。
