Meta 与伊利诺伊大学研究人员联合开发了 EvoHarness-RL 框架,使大语言模型智能体能够自主创建、访问和管理外部状态系统。
据 Techub 转引 CryptoBriefing 报道,这一框架在 ALFWorld 基准测试中的成功率从 47.9% 提升至 96.9%。
EvoHarness-RL的核心结构
该框架通过 Belief、Progress 和 Experience 三个组件构建结构化外部状态,并采用监督微调和 GRPO 优化技术进行训练。
训练过程中的自发行为
研究还观察到,智能体在训练过程中出现了「工具退火」和「工具进化」两种自发行为,能够逐步内化操作并优化外部状态结构。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

