AI币圈交易赛结果出炉:ChatGPT巨亏63%,仅两款模型实现盈利

AI币圈交易赛结果出炉:ChatGPT巨亏63%,仅两款模型实现盈利

N
News Editor 01
2026-07-05 20:26:11
一场由六款大语言模型参与的加密交易竞赛落幕,四款模型最终亏损,ChatGPT跌幅最大达63%。仅DeepSeek与QWEN3 MAX录得正收益,结果凸显LLM在数值时序与交易执行中的明显短板。

一场备受关注的大语言模型(LLM)加密货币交易竞赛“Alpha Arena”近日收官,最终结果显示,当前主流通用型AI模型在真实交易决策中的表现仍难言理想。根据主办方Nof1公布的数据,参赛的六款模型中有四款以亏损告终,其中OpenAI的ChatGPT从1万美元初始资金中亏掉6267美元,跌幅高达63%,成为本轮表现最差的模型。

这场比赛持续了两周多,所有模型在相同提示词和约束条件下进行加密资产交易。除ChatGPT外,Google的Gemini、X旗下的Grok以及Anthropic的Claude Sonnet也都未能守住本金,最终账户余额均低于起始的1万美元。其中,Gemini亏损5671美元,Grok亏损4531美元,Claude Sonnet亏损3081美元。相比之下,仅有High-Flyer的DeepSeek和阿里巴巴的QWEN3 MAX实现正收益,分别盈利489美元和2232美元。

四亏二盈,交易成本吞噬大部分表现

从结果来看,本次竞赛最大的共性问题并非单纯方向判断失误,而是过度交易带来的成本侵蚀。Nof1指出,在比赛早期,模型的盈亏表现很大程度上被交易费用主导,因为部分代理频繁买卖,只获得很小的短线收益,但这些收益很快被手续费抹去。

手续费数据进一步印证了这一点。QWEN3 MAX虽然最终盈利,但其支付的交易费用也最高,累计达到1654美元;而亏损严重的Gemini同样产生了高额费用,累计达1331美元。从交易次数看,Gemini总共执行了238笔交易,明显高于Claude Sonnet的38笔,反映出不同模型在交易风格上的显著差异。

主办方还提到,Grok、ChatGPT和Gemini更倾向于进行做空操作,而Claude Sonnet则“很少”做空。这说明即使在相同任务框架下,不同LLM仍表现出较稳定的策略偏好,主办方将其称为类似投资“人格”的一致性偏差。

最高点曾翻倍,但多数模型难以守住收益

值得注意的是,比赛过程并非全程低迷。主办方透露,到了10月27日,六款模型整体表现一度来到高点,其中QWEN3 MAX与DeepSeek曾短暂实现资金翻倍,Claude Sonnet和Grok也曾阶段性转为盈利。然而,这种高光时刻并未持续,最终多数模型在后续波动中回吐收益,重新跌回亏损区间。

相比之下,ChatGPT和Gemini在整个比赛的大部分时间里都处于水下状态,几乎始终未能摆脱亏损。这一结果表明,在高波动、强噪音、强执行纪律要求的加密市场中,通用大模型即便具备语言理解和推理能力,也未必能直接转化为稳定的交易胜率。

从统计维度看,六款模型的整体胜率区间仅在25%到30%之间,说明无论是盈利模型还是亏损模型,在单笔交易层面都未形成足够强的优势。QWEN3 MAX和DeepSeek之所以最终录得正收益,更可能与风险控制、持仓节奏和费用承受能力有关,而非压倒性的方向判断能力。

为何LLM难以胜任加密交易

Nof1创始人Jay Azhang表示,这场比赛的设计本身就有意提高难度,目的之一是观察LLM在受限环境中的真实边界。他指出,LLM并不擅长处理数值型时间序列数据,而比赛提供给模型的上下文恰恰主要是这类信息。此外,参赛模型还面对受限的资产范围、较小的动作空间,以及严格的输出规则。

按照Nof1的总结,每个AI代理都必须在有限上下文窗口内,解析噪声较大的市场特征、结合当前账户状态完成推理,并输出结构化交易动作。这种任务形式本质上更接近系统化量化交易,而不是传统意义上的文本问答。对于主要训练目标仍是语言生成与语义理解的LLM而言,这显然不是最擅长的赛道。

换句话说,本次比赛并不意味着AI无法参与加密交易,而是说明通用型大语言模型若未经针对性金融训练和策略优化,直接用于短线交易仍存在明显缺陷。尤其在手续费、滑点、仓位管理和连续决策等环节上,模型的短板会被市场迅速放大。

市场影响:AI交易叙事需回归现实

本次竞赛结果对于当前火热的“AI+加密交易”叙事具有一定降温作用。过去一段时间,市场对AI代理、自动化交易机器人和链上智能策略的期待不断升温,不少投资者甚至将LLM视为下一代交易基础设施的重要组成部分。但此次实测表明,至少在现阶段,通用LLM距离“稳定赚钱的交易员”仍有不小距离。

对市场参与者而言,这一结果的意义在于重新认识AI工具的定位。LLM或许更适合用于新闻摘要、情绪归纳、研究辅助和策略解释,而非直接承担高频或高波动环境下的自主买卖决策。尤其是在加密市场这样24小时运转、情绪驱动强、价格噪音密集的领域,单靠语言模型生成交易指令,风险仍然较高。

不过,这场竞赛也并非完全悲观。DeepSeek和QWEN3 MAX的盈利说明,经过适当约束和提示优化后,部分模型仍具备一定适应性。Nof1也表示,未来还将推出新一轮交易竞赛,并引入更优提示词以及更强的统计严谨性。若后续实验能改善输入结构、降低过度交易并增强风险管理,AI模型在加密投资领域仍有继续演进的空间。

总体来看,这场“Alpha Arena”更像是一次压力测试:它没有证明LLM已经能战胜市场,反而清晰揭示了其在数值处理、交易执行和费用控制方面的现实局限。在AI与加密融合持续推进的背景下,这份成绩单提醒市场,真正可用的智能交易系统,距离单纯依赖聊天模型还有很长一段路要走。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。