AI Crypto Trading Contest Ends With ChatGPT Down 63%, Only Two Models Profitable

AI Crypto Trading Contest Ends With ChatGPT Down 63%, Only Two Models Profitable

N
News Editor 01
2026-07-05 20:26:11
In Nof1’s Alpha Arena crypto trading contest, four of six LLMs ended with losses, led by ChatGPT’s 63% drawdown. Only DeepSeek and QWEN3 MAX posted gains, highlighting the limits of general-purpose LLMs in time-series analysis, trading execution, and fee control.

一场备受关注的大语言模型(LLM)加密货币交易竞赛“Alpha Arena”近日收官,最终结果显示,当前主流通用型AI模型在真实交易决策中的表现仍难言理想。根据主办方Nof1公布的数据,参赛的六款模型中有四款以亏损告终,其中OpenAI的ChatGPT从1万美元初始资金中亏掉6267美元,跌幅高达63%,成为本轮表现最差的模型。

这场比赛持续了两周多,所有模型在相同提示词和约束条件下进行加密资产交易。除ChatGPT外,Google的Gemini、X旗下的Grok以及Anthropic的Claude Sonnet也都未能守住本金,最终账户余额均低于起始的1万美元。其中,Gemini亏损5671美元,Grok亏损4531美元,Claude Sonnet亏损3081美元。相比之下,仅有High-Flyer的DeepSeek和阿里巴巴的QWEN3 MAX实现正收益,分别盈利489美元和2232美元。

四亏二盈,交易成本吞噬大部分表现

从结果来看,本次竞赛最大的共性问题并非单纯方向判断失误,而是过度交易带来的成本侵蚀。Nof1指出,在比赛早期,模型的盈亏表现很大程度上被交易费用主导,因为部分代理频繁买卖,只获得很小的短线收益,但这些收益很快被手续费抹去。

手续费数据进一步印证了这一点。QWEN3 MAX虽然最终盈利,但其支付的交易费用也最高,累计达到1654美元;而亏损严重的Gemini同样产生了高额费用,累计达1331美元。从交易次数看,Gemini总共执行了238笔交易,明显高于Claude Sonnet的38笔,反映出不同模型在交易风格上的显著差异。

主办方还提到,Grok、ChatGPT和Gemini更倾向于进行做空操作,而Claude Sonnet则“很少”做空。这说明即使在相同任务框架下,不同LLM仍表现出较稳定的策略偏好,主办方将其称为类似投资“人格”的一致性偏差。

最高点曾翻倍,但多数模型难以守住收益

值得注意的是,比赛过程并非全程低迷。主办方透露,到了10月27日,六款模型整体表现一度来到高点,其中QWEN3 MAX与DeepSeek曾短暂实现资金翻倍,Claude Sonnet和Grok也曾阶段性转为盈利。然而,这种高光时刻并未持续,最终多数模型在后续波动中回吐收益,重新跌回亏损区间。

相比之下,ChatGPT和Gemini在整个比赛的大部分时间里都处于水下状态,几乎始终未能摆脱亏损。这一结果表明,在高波动、强噪音、强执行纪律要求的加密市场中,通用大模型即便具备语言理解和推理能力,也未必能直接转化为稳定的交易胜率。

从统计维度看,六款模型的整体胜率区间仅在25%到30%之间,说明无论是盈利模型还是亏损模型,在单笔交易层面都未形成足够强的优势。QWEN3 MAX和DeepSeek之所以最终录得正收益,更可能与风险控制、持仓节奏和费用承受能力有关,而非压倒性的方向判断能力。

为何LLM难以胜任加密交易

Nof1创始人Jay Azhang表示,这场比赛的设计本身就有意提高难度,目的之一是观察LLM在受限环境中的真实边界。他指出,LLM并不擅长处理数值型时间序列数据,而比赛提供给模型的上下文恰恰主要是这类信息。此外,参赛模型还面对受限的资产范围、较小的动作空间,以及严格的输出规则。

按照Nof1的总结,每个AI代理都必须在有限上下文窗口内,解析噪声较大的市场特征、结合当前账户状态完成推理,并输出结构化交易动作。这种任务形式本质上更接近系统化量化交易,而不是传统意义上的文本问答。对于主要训练目标仍是语言生成与语义理解的LLM而言,这显然不是最擅长的赛道。

换句话说,本次比赛并不意味着AI无法参与加密交易,而是说明通用型大语言模型若未经针对性金融训练和策略优化,直接用于短线交易仍存在明显缺陷。尤其在手续费、滑点、仓位管理和连续决策等环节上,模型的短板会被市场迅速放大。

市场影响:AI交易叙事需回归现实

本次竞赛结果对于当前火热的“AI+加密交易”叙事具有一定降温作用。过去一段时间,市场对AI代理、自动化交易机器人和链上智能策略的期待不断升温,不少投资者甚至将LLM视为下一代交易基础设施的重要组成部分。但此次实测表明,至少在现阶段,通用LLM距离“稳定赚钱的交易员”仍有不小距离。

对市场参与者而言,这一结果的意义在于重新认识AI工具的定位。LLM或许更适合用于新闻摘要、情绪归纳、研究辅助和策略解释,而非直接承担高频或高波动环境下的自主买卖决策。尤其是在加密市场这样24小时运转、情绪驱动强、价格噪音密集的领域,单靠语言模型生成交易指令,风险仍然较高。

不过,这场竞赛也并非完全悲观。DeepSeek和QWEN3 MAX的盈利说明,经过适当约束和提示优化后,部分模型仍具备一定适应性。Nof1也表示,未来还将推出新一轮交易竞赛,并引入更优提示词以及更强的统计严谨性。若后续实验能改善输入结构、降低过度交易并增强风险管理,AI模型在加密投资领域仍有继续演进的空间。

总体来看,这场“Alpha Arena”更像是一次压力测试:它没有证明LLM已经能战胜市场,反而清晰揭示了其在数值处理、交易执行和费用控制方面的现实局限。在AI与加密融合持续推进的背景下,这份成绩单提醒市场,真正可用的智能交易系统,距离单纯依赖聊天模型还有很长一段路要走。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.