RLHF

OpenAI
2026-09-10 10:12:40

Paul Christiano加入OpenAI董事架构后警告超级智能失控风险

OpenAI已将前对齐研究负责人 Paul Christiano 请回董事架构。Christiano 曾在 2017 至 2021 年负责对齐研究,并参与 RLHF 奠基工作。此次他进入 OpenAI Foundation 董事会、安全与安保委员会,并以观察员身份加入 OpenAI Group 董事会。他在上任后公开表示,如果在解决对齐问题前造出超级智能,人类可能永久失去控制,「大多数人可能死亡」。

10
Paul Christiano加入OpenAI董事架构后警告超级智能失控风险
人工智能
2026-08-31 10:55:20

从达特茅斯提案到黄仁勋表态,人工智能 70 年争议史

MarsBit 刊文回顾人工智能 70 年演进史,切入点是黄仁勋在 2026 年 8 月 26 日英伟达财报电话会上称「对于很多任务来说,我们可以说已经实现了 AGI」。报道从 1955 年达特茅斯提案写起,梳理符号主义、神经网络、专家系统、机器学习、深度学习与 Transformer 的交替起伏,并指出 AI 历史中的寒冬、改名、路线之争与 AGI 定义模糊问题,至今仍在延续。

280
从达特茅斯提案到黄仁勋表态,人工智能 70 年争议史
Anthropic
2026-08-10 08:01:09

2000 年美国物理奥赛名单再被翻出,Anthropic CEO 曾在落选 24 人中

一份由美国物理教师协会保存的 2000 年美国物理奥赛 24 人集训队名单,近期在社交平台被重新传播。名单中出现了 Anthropic CEO Dario Amodei,以及 Lighter 创始人 Vladimir Novakovski、Duolingo AI 研究工程师 Badr Albanna、UC Berkeley 教师 Nilah Monnier Ioannidis 等名字。名单对应的选拔发生在马里兰大学,最终 5 人代表美国参加第 31 届国际物理奥赛并全部获奖。报道还梳理了多名入选者此后在 AI、金融科技、计算生物学、法学和计算机领域的去向。

7710
2000 年美国物理奥赛名单再被翻出,Anthropic CEO 曾在落选 24 人中
人工智能
2026-07-22 20:50:14

21场AI核战兵推:95%动用核武,零次退让

伦敦国王学院让 GPT-5.2、Claude Sonnet 4、Gemini 3 Flash 进行 21 场兵棋推演,结果 95% 对局出现核武使用,且没有任何一次选择退让或投降。

250
21场AI核战兵推:95%动用核武,零次退让
ICML 2026
2026-07-06 03:29:56

ICML 2026大奖揭晓:扩散模型双获杰出论文,DeepMind A3C摘时间检验奖

ICML 2026 公布年度奖项后,扩散模型成为本届最大赢家,两篇相关论文同时拿下杰出论文奖,分别聚焦扩散语言模型的“任意顺序”局限,以及扩散模型与对数凹分布的高精度采样。与此同时,一篇批评 AI 对齐社区可能无意构建审查工具的立场论文获得表彰。时间检验奖则授予 DeepMind 2016 年提出 A3C 的经典强化学习论文。

1100
ICML 2026大奖揭晓:扩散模型双获杰出论文,DeepMind A3C摘时间检验奖