Alpha Arena Crypto Trading Contest Shows LLMs Still Struggle to Trade Crypto

Alpha Arena Crypto Trading Contest Shows LLMs Still Struggle to Trade Crypto

N
News Editor 01
2026-07-05 20:29:11
In Nof1’s Alpha Arena crypto trading contest, four of six major LLMs finished with losses, led by ChatGPT after losing 63% of its capital. Only DeepSeek and QWEN3 MAX ended profitable, while trading fees and over-trading emerged as key drags on performance.

一场围绕大型语言模型(LLM)展开的加密货币交易竞赛,给市场泼下了一盆冷水。根据Nof1举办的“Alpha Arena”比赛结果,在参赛的六个主流模型中,有四个最终亏损,且ChatGPT以63%的资金回撤成为表现最差者。这场持续约两周多的实验,原本试图检验通用大模型在统一提示词和相同约束下进行加密资产交易的能力,但最终成绩表明,当前LLM距离稳定胜任短线或规则化交易仍有明显差距。

六大模型同场竞技,四家最终收跌

本次比赛由Nof1发起,于周一晚间结束。参赛模型包括OpenAI的ChatGPT、Google的Gemini、X的Grok、Anthropic的Claude Sonnet,以及High-Flyer的DeepSeek和阿里巴巴的QWEN3 MAX。所有模型的起始资金均为10,000美元,并在相同提示框架下进行加密货币交易。

从最终结果看,ChatGPT、Gemini、Grok和Claude Sonnet的账户余额均低于初始资金。其中,ChatGPT亏损6,267美元,是六个模型中损失最大者;Gemini亏损5,671美元Grok亏损4,531美元Claude Sonnet亏损3,081美元。只有两个模型在比赛结束时保住正收益,分别是DeepSeek盈利489美元,以及表现最好的QWEN3 MAX盈利2,232美元

如果以收益结构来看,六个模型的整体表现并不理想。报道指出,所有模型的胜率大致都落在25%至30%之间,这意味着即便个别模型最终录得盈利,也并未展现出显著高于其他模型的方向判断优势,更多反映的是交易频率、成本控制和风险暴露管理上的差异。

过度交易与手续费,吞噬了模型收益

此次实验中,一个值得关注的结论是:交易成本显著影响了最终盈亏。Nof1指出,在早期测试中,模型普遍存在“过度交易”问题,频繁尝试获取快速且微小的利润,但这些收益往往被手续费直接抹去。

从交易次数来看,Gemini总共完成了238笔交易,而Claude Sonnet仅进行了38笔,两者风格差异明显。手续费方面,QWEN3 MAX支付了所有模型中最高的交易费用,达到1,654美元;Gemini也支付了1,331美元的手续费。尽管QWEN3 MAX最终实现盈利,但高昂成本说明其盈利空间同样经受了严峻考验。

另外,Grok、ChatGPT和Gemini在策略上更倾向于做空,而Claude Sonnet则“很少”做空。这种风格偏好也反映出不同模型在面对同类市场信息时,会形成相对稳定的决策倾向,而非完全随机应对。

中途一度翻倍,但多数模型未能守住收益

比赛过程中并非毫无亮点。根据披露数据,10月27日是各模型表现最强的阶段。彼时,QWEN3 MAX和DeepSeek一度实现资金翻倍,Claude Sonnet和Grok也曾短暂进入盈利区间。然而,ChatGPT和Gemini几乎在整个竞赛期间都处于亏损状态,未能有效扭转颓势。

这一轨迹说明,大模型在某些阶段可能捕捉到趋势性机会,但在持仓管理、风险控制和连续决策能力上,仍难以稳定保持优势。尤其是在波动较高、噪音较强的加密货币市场中,模型可能更容易因为频繁修正判断而造成收益回吐。

主办方:LLM并不擅长处理时间序列数据

Nof1发起人Jay Azhang表示,举办该比赛的目标之一,是为未来构建专用的加密交易AI模型积累经验。他指出,所有参赛模型在比赛中都表现出“持续一致的偏见”,有点类似投资中的“人格特征”。

他同时承认,这次比赛的设置本身就刻意提高了难度。Azhang称,LLM并不真正擅长处理数值型时间序列数据,而这恰恰是此次提供给模型的主要上下文信息。此外,模型可交易的资产范围受限,可执行的操作空间也较为有限。

Nof1在赛后总结中进一步表示,尽管组织方已尽量为模型创造公平环境,但测试框架仍带来真实约束:模型需要在有限上下文窗口中,解析噪声较大的市场特征,将其与当前账户状态联系起来,在严格规则下完成推理,并输出结构化交易动作。这些要求对于通用LLM而言,显然并不轻松。

对AI交易与加密市场意味着什么

这场竞赛传递出的信息,对当前火热的“AI+交易”叙事具有一定提醒意义。首先,通用型大语言模型虽然在文本理解、总结和交互方面优势突出,但并不等同于成熟的量化交易系统。加密市场对时序数据、执行纪律、成本控制和仓位管理要求极高,而这些能力并不能仅凭自然语言推理自动获得。

其次,比赛结果显示,交易频率并不天然带来更高收益。在高波动且存在明确交易摩擦的市场里,过度交易很容易让模型陷入“赚小钱、亏手续费”的困境。对于正在尝试部署AI代理进行链上或交易所自动化交易的团队而言,如何限制无效交易、优化执行成本,可能比单纯提升预测能力更重要。

最后,这也说明未来AI交易系统的发展方向,或许不会是单靠通用LLM独立完成所有决策,而是将其与专门处理市场数据的模型、风控模块和执行引擎结合,形成多层协同架构。Nof1已经表示,后续还会推出新一轮交易竞赛,并采用更好的提示设计以及更强的统计严谨性。

总体来看,这次“Alpha Arena”并没有证明LLM已经能够稳定交易加密货币,反而进一步暴露出其在数值推理、市场噪音处理和实盘风控方面的短板。但从实验价值看,这类公开对比测试仍有助于行业更清晰地认识AI交易的真实边界,并为下一代专业化加密交易模型提供可参考的改进方向。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.