LLM Crypto Trading Contest Ends With ChatGPT Down 63%, Only Two Models Profitable

LLM Crypto Trading Contest Ends With ChatGPT Down 63%, Only Two Models Profitable

N
News Editor 01
2026-07-05 20:29:11
A crypto trading contest among six major LLMs found that four finished below their $10,000 starting balance, with ChatGPT posting the worst result at a 63% loss. Only DeepSeek and QWEN3 MAX ended in profit, while overtrading and fees weighed heavily on performance.

一场围绕大语言模型(LLM)展开的加密货币交易实测,给“AI自动炒币”这一热门叙事泼了一盆冷水。由Nof1组织的“Alpha Arena”加密交易竞赛在本周一结束,六个主流LLM在相同提示词和相近约束条件下进行了为期两周多的实盘风格比拼,但最终结果并不理想:6个模型中有4个亏损,且ChatGPT以63%的资金回撤成为表现最差者

四个模型跌破初始资金,仅两家录得正收益

根据比赛披露的数据,所有模型均以1万美元作为起始资金。最终,OpenAI的ChatGPT、Google的Gemini、X平台的Grok以及Anthropic的Claude Sonnet都未能守住本金。具体来看,ChatGPT亏损6267美元,账户余额大幅缩水;Gemini亏损5671美元Grok亏损4531美元Claude Sonnet亏损3081美元

本轮比赛中,唯二实现盈利的是High-Flyer的DeepSeek和阿里巴巴的QWEN3 MAX。其中,DeepSeek盈利489美元,QWEN3 MAX盈利2232美元。从结果看,即便在多数模型普遍承压的背景下,部分LLM仍展现出一定的交易适应能力,但整体优势并不稳固。

高频操作与手续费侵蚀,成为成绩分化关键

从操作风格来看,不同模型之间呈现出明显差异。Gemini总共进行了238笔交易,而Claude Sonnet仅执行了38笔,两者在交易频率上相差悬殊。Nof1指出,比赛初期的盈亏表现很大程度上被交易成本主导,原因在于一些模型存在明显的过度交易倾向,频繁进行小幅获利尝试,但这些微薄收益最终被手续费吞噬。

手续费数据进一步印证了这一点。QWEN3 MAX虽然最终盈利,但其支付的手续费也是全场最高,达到1654美元;Gemini则支付了1331美元的手续费,在大幅亏损的同时还承担了较高的交易成本。整体而言,六个模型的胜率仅在25%至30%之间,说明它们不仅没有形成稳定优势,反而在高噪音、高波动的市场中频繁做出低效率决策。

此外,在做空偏好上,Grok、ChatGPT和Gemini相比其他模型更倾向于采取空头策略,而Claude Sonnet则“很少”做空。这种风格差异,也体现出模型在同样任务框架下会形成相对稳定的行为偏向。

比赛中期曾一度翻倍,但最终多数回吐收益

值得注意的是,这些模型并非从一开始就全线失利。比赛数据显示,到了10月27日时,QWEN3 MAX与DeepSeek一度实现资金翻倍,Claude和Grok也曾短暂处于盈利区间。相比之下,ChatGPT与Gemini在几乎整个比赛期间都处于亏损状态,缺乏明显反弹。

这说明LLM在某些阶段可能能够捕捉到局部行情机会,但从持续性和风险控制角度看,仍难以建立稳健策略。一旦市场环境变化或交易成本累积,账面利润便容易迅速回吐。这也是当前AI交易系统在真实市场中面临的核心挑战之一:不仅要“看对方向”,还要在执行、仓位、频率和成本控制之间取得平衡。

主办方:LLM并不擅长处理数值时间序列

Nof1发起这场比赛的初衷,是希望为未来构建专门的加密交易AI模型积累经验。项目发起人Jay Azhang在赛后表示,这些模型在整个比赛中都展现出“持续一致的偏见”,类似于一种投资“人格”。也就是说,即便输入条件类似,不同LLM仍会反复表现出特定风格,例如偏好多空方向、交易频率或对信号的反应方式。

不过,Azhang同时强调,比赛设置本身是有意提高难度的。他指出,LLM并不真正擅长处理数值型时间序列数据,而比赛提供给它们的主要正是这类上下文信息。与此同时,参赛模型还被限制在较窄的资产范围和有限的动作空间内,需要在受限上下文窗口中解析噪音较多的市场特征、结合当前账户状态进行推理,并输出结构化交易动作。

换言之,这场比赛更像是一次“压力测试”,考验的是通用大模型在复杂金融任务中的适配能力,而非专门训练的量化交易引擎。因此,当前结果更多说明:通用LLM距离成为成熟的独立加密交易员,仍有明显差距。

市场影响:AI交易叙事需回归现实,专用模型或成下一步方向

从市场层面看,这场比赛释放出一个重要信号:围绕“AI代理自动交易加密资产”的想象空间虽然很大,但现阶段真正落地仍受到模型能力、成本结构和策略鲁棒性的多重限制。尤其是在加密市场这种高波动、强噪音、24小时运行的环境中,单靠通用语言模型直接生成交易决策,短期内难言可靠。

这对AI概念相关项目和交易基础设施赛道也有启示意义。未来更具商业价值的方向,可能不是让通用聊天模型直接下单,而是将LLM用于辅助研究、信息提取、策略解释和风险监控,再与传统量化框架、回测系统和执行引擎结合,形成混合式架构。相比“让AI完全接管交易”,这种模式可能更符合当前技术成熟度。

Nof1方面也表示,后续还将举行新一轮交易竞赛,并会采用更好的提示词设计以及更强的统计严谨性。这意味着,LLM在加密交易领域的探索并未结束。只是从本轮结果来看,市场或许需要重新评估:AI会改变交易行业,但这条路显然比想象中更长,也更依赖专门化训练与系统工程能力。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.