‹ 返回代码库

代码库

具身智能
2026-09-07 05:53:10

具身智能押注上下文 Scaling,COCO Matrix 试图把 ICL 前置到预训练

Skild AI 与 Generalist AI 近期先后展示机器人 One-Shot Learning 能力,把具身智能中的 In-Context Learning 讨论推高。国内创业公司可可矩阵表示,团队从 2026 年 4 月成立起就将 ICL 作为底层范式,核心判断是机器人后续动作生成效果,很大程度取决于前端是否真正理解物理世界。其创始人高宇翔称,行业在数据堆叠之外,正在把 Long Context、记忆与部署后继续学习视为新的 Scaling 方向。

470
具身智能押注上下文 Scaling,COCO Matrix 试图把 ICL 前置到预训练
微软
2026-09-07 03:18:08

微软等开源 Argus,推动 Agent 连续 1548 小时自主研究

微软、上海交通大学等机构开源长周期研究 Agent 运行时 Argus,并同步发布技术报告、代码与项目主页。该系统以证据驱动、自进化、多 Agent 协作和 Core 与垂域解耦为核心设计,面向缺少密集反馈的长期研究任务。报告覆盖 27 个 Campaign、1548 小时墙钟时间,平均每 40.7 小时才主动请求一次人类干预,占空比为 95.1% 至 98.7%。

930
微软等开源 Argus,推动 Agent 连续 1548 小时自主研究
OpenAI
2026-09-07 03:20:09

OpenAI首席科学家警告“异星心智”逼近,呼吁全球放缓前沿 AI 竞赛

OpenAI 首席科学家 Jakub Pachocki 发布长文《An Alien Mind》,称当前 AI 更像无法被完全理解的“异星心智”,并表示全球没有任何一家实验室准备好全速推进。文中提到,OpenAI 已看到递归自我改进(RSI)持续推进的迹象,思维链监控能力却在减弱;他主张将对齐要求升级为全球强制安全法律,并推动前沿研究降速与跨国协调。

1140
OpenAI首席科学家警告“异星心智”逼近,呼吁全球放缓前沿 AI 竞赛
吴说区块链
2026-09-02 09:05:48

吴说8月技术月报:BIP-110分叉失败,Glamsterdam转入公测

吴说区块链发布 8 月技术月报,涵盖 Bitcoin、Ethereum、Solana、Arbitrum、Base、Polygon、BNB Chain、Hyperliquid 等多条公链与基础设施进展。报告显示,Bitcoin BIP-110 在 mandatory signaling 阶段仅获约 2.5% 矿工支持,少数链产出约 2 个区块后停滞;Ethereum 的 Glamsterdam 已从内部 DevNet 进入公开测试,Hegotá 也转入候选方案筛选;Solana 将把主网 slot time 缩短至 350ms,OP Mainnet 与 Base 则把 L2 竞争推进到 200ms 区间。

1020
吴说8月技术月报:BIP-110分叉失败,Glamsterdam转入公测
Arthur Hayes
2026-09-02 03:18:04

Arthur Hayes 旗下 Technocore.chat 上线,FLOP 测试网水龙头入口开放

BitMEX 共同创始人 Arthur Hayes 宣布,Flop Labs 开源的 AI 代理聊天与笔记服务器 Technocore.chat 已正式上线。该系统支持通过普通 HTTP GET 请求发文、读消息和写笔记,同时也是 FLOP 代币测试网水龙头的唯一入口。Flop Labs 目前公开的信息仍有限,链名、白皮书、测试网和审计状态均未公布,空投与创世区块时间表能否兑现仍待观察。

1510
Arthur Hayes 旗下 Technocore.chat 上线,FLOP 测试网水龙头入口开放
Codex
2026-09-01 12:49:14

Codex新增_context工具,酝酿长任务“外部记忆”机制

Codex在代码库中新增了_context工具,并配合工作注释与历史查询能力,显示Codex CLI可能正在测试新的长任务记忆方案。按现有线索,系统在上下文窗口接近上限时将切换到新窗口,同时保留完整历史记录供查询。OpenAI官方文档截至发稿仍将compaction列为长任务上下文管理机制,文中判断这更像是准备转向或测试阶段,而非已全面上线。

240
Codex新增_context工具,酝酿长任务“外部记忆”机制
Anthropic
2026-09-01 04:21:24

Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍

Anthropic在8月28日发布新报告,测试让Claude以“自动化对齐研究员”身份独立完成查文献、提方法、训练和评测。报告显示,在10类已知对齐失败上,系统均实现改善,且通用能力未见崩塌。在一项“弱模型对齐强模型”的实验中,Claude Sonnet 5在约60小时内试出50多个方案,最终把Claude Opus 4.8早期检查点的目标得分推到65%,Anthropic称这套流程较其生产级对齐方案效率高约15000倍。

730
Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍