‹ 返回事实错误

事实错误

Saturn
2026-09-20 15:27:01

Saturn:主流 AI 回答个人财务问题错误率达 57%

英国金融科技公司 Saturn 发布研究称,主流 AI 模型在个人财务问题上的回答错误率达到 57%。研究覆盖 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型,共测试 121 个问题并生成逾 1 万条答案。多步骤问题错误率升至 88%,免费模型错误率为 63%,表现最好的 Claude Opus 5 在推理模式下仍有 39% 错误率。

180
Saturn:主流 AI 回答个人财务问题错误率达 57%
政策监管
2026-09-11 02:53:59

美议员称特朗普或放宽中国汽车入美限制,三大车厂股价走低

美国民主党参议员 Elissa Slotkin 在 X 发文称,特朗普可能在即将举行的特朗普—习近平会晤协议中,放宽中国汽车进入美国市场的限制。消息传出后,福特、通用汽车和 Stellantis 周三分别下跌 3.93%、2.37% 和 1.86%。不过,白宫尚未公布相关计划,同期香港上市的比亚迪与吉利也一度走弱,市场对传言真实性仍存疑。

740
美议员称特朗普或放宽中国汽车入美限制,三大车厂股价走低
StudentSim
2026-09-10 08:21:08

StudentSim 用真实数据训练 60 个数字学生,瞄准个性化 AI 教学

研究团队发布 StudentSim,尝试用真实学生记录训练可评估、可复用的学生模拟器,让 AI tutor 在训练阶段获得更低成本的反馈。该方法围绕行为保真度和指导响应性两项能力展开,并在国际象棋、英语写作和基础数学三类任务中评估 60 位真实学生数据。论文还将 StudentSim 接入 AI tutor 强化学习流程,在国际象棋实验里,使用 StudentSim 作为奖励信号训练出的 tutor 在准确性、指导质量和个性化评分上均排第一。

710
StudentSim 用真实数据训练 60 个数字学生,瞄准个性化 AI 教学
ChatGPT
2026-09-02 04:25:09

ChatGPT代写争议再起:AI署名辅助背后仍是代笔伦理旧题

MarsBit报道称,围绕ChatGPT辅助写作的争议,实质上延续了持续百年的代笔伦理讨论。文章以范德堡大学在校园枪击案后发送安抚邮件并注明由ChatGPT改写辅助完成一事为切口,指出无论是人工代笔还是AI辅助,真正引发反感的并非工具本身,而是署名者是否真实表达了自己的想法。

760
ChatGPT代写争议再起:AI署名辅助背后仍是代笔伦理旧题
AI产业
2026-08-25 05:33:19

2026 年 8 月 AI 产业月报:模型、融资与治理分化加剧

ABMedia整理的 2026 年 8 月 AI 产业月报显示,Google、xAI、DeepSeek 与 OpenAI 在模型更新上密集出招,开源与匿名模型也同步升温。资金端则集中流向算力、芯片与连接层,英伟达、Anthropic、Stripe 都有大动作。与此同时,AI 安全、伦理与训练数据争议继续扩大,治理节奏仍落后于技术与资本推进速度。

1110
2026 年 8 月 AI 产业月报:模型、融资与治理分化加剧
谷歌研究
2026-08-14 07:41:09

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”

谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

1220
谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”
OpenAI
2026-08-05 09:03:24

OpenAI公开反驳苹果窃密诉讼,称其多项指控与事实不符

OpenAI 就苹果商业窃密诉讼公开回应,称苹果在联系记录、离职员工权限与涉案人员行为上存在多项事实错误。OpenAI披露邮件与聊天记录称,苹果律师曾发错邮件、误称有电话沟通,离职员工 Chang Liu 是应苹果员工请求协助定位文件,Tang Tan 则一直明确拒绝接触其他公司的机密信息。OpenAI表示,苹果申请初步禁令既基于虚假信息,也没有必要。

1670
OpenAI公开反驳苹果窃密诉讼,称其多项指控与事实不符