Andrej Karpathy公开语音 Prompt 方法:与 AI 连讲 10 分钟

Andrej Karpathy公开语音 Prompt 方法:与 AI 连讲 10 分钟

N
News Editor
2026-07-22 07:55:54
OpenAI 联合创始成员、现任 Anthropic 预训练团队成员 Andrej Karpathy 在 X 披露自己与大语言模型协作的一套固定方法:遇到复杂任务时,直接切换语音输入连续讲 10 分钟,把零散背景一次性交给模型整理。他表示,LLM 很擅长从冗长且混乱的独白中还原真实意图,这样做能减少后续反复澄清。围绕这套做法,X 上也出现了对效率提升与写作能力退化的不同看法。
Andrej KarpathyAnthropicOpenAI大语言模型Prompt语音输入人工智能

OpenAI 联合创始成员、现任 Anthropic 预训练团队成员 Andrej Karpathy 周二(7/21)在 X 公开了自己与大语言模型协作的一套固定方法:碰到复杂任务时,他通常不打字,而是直接切到语音输入,连续讲 10 分钟,把想到的内容一次说完。

Karpathy 说,这种做法适用于模型需要更多背景信息、但打字速度跟不上思路的时候。按照他的描述,他会往椅背一靠,切到 /voice,然后开始一段长篇独白,内容可以跳跃、混乱,也不需要提前整理结构。

他在帖文中写道:“One pattern I find useful for working with LLMs is a nice long ramble session. Sometimes the LLM needs more bits to understand what you're trying to achieve, but you're too lazy to type them. In these cases I like to lean back, switch to /voice and just ramble for like 10…”

Karpathy 还提到,有时他会先告诉模型自己已经切换到语音识别,并在开头补一句,若有错字先致歉。也有时候,他会把这段独白变成一场小型访谈,让模型反过来追问几轮,把分散的线索逐步挖出来。

重点不在语音,而在一次性交付更多输入

在这套方法里,语音输入本身并不是新鲜功能。Karpathy 真正强调的是输入量:与其花时间把想法压缩成一段结构完整的 Prompt,不如把整包思路直接交给模型,再由模型拆解、重组并输出更清晰的版本。

他给出的理由也很直接。按他的说法,LLM 很擅长重建冗长而语无伦次的独白,模型返回的版本,往往比原始思绪更干净。他认为,这会改善他所说的 mind meld,也就是人与模型对彼此意图的理解逐步对齐。到了这个阶段,后面需要回头纠正的地方反而会变少。

把成本压到前 10 分钟,换掉后面的反复修改

这套方法背后的逻辑,是把协作成本尽量前置。很多人在前期省下打字和整理 Prompt 的时间,后面却要花更多轮对话解释“不是这个意思”。Karpathy 的做法则相反:把大量背景、上下文和模糊想法集中在前 10 分钟交代清楚,用一次高密度输入,减少后续来回澄清。

按原文的表述,这相当于以前面一次超大量的信息输入,去替换后面多轮修正和补充。

X 回复区出现两种看法

围绕这套做法,X 回复区大致分成两派。

支持者认为,这种方式已经占到自己约八成的 Prompt 使用场景。也有人表示,在改用语音为主之后,产出效率提高了 5 到 8 倍。对多语使用者来说,这种方法的吸引力还在于不受单一语言限制。

另一派的担忧则集中在同一个问题:如果把“把话讲清楚”这件事整体外包给模型,长期下来,自己的组织能力和写作能力是否会退化。对此,也有人提出折中做法,即先让模型整理,再由用户自己手动蒸馏一遍,而不是直接照单全收。

Karpathy 的用法更像整理镜子,而不是代笔

从文章给出的脉络看,这套方法的核心并不是让模型代替人写作,而是把模型当作一个能够整理信息的镜子:先把还未成形的思路完整抛出去,再检查模型整理后的版本是否准确反映自己的真实意图。

差别不在模型有没有帮忙重组内容,而在用户是否会把整理后的结果重新读回去、继续判断和取舍。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。