「vibe coding」概念提出者、OpenAI 共同创办人 Andrej Karpathy 公开力挺 Anthropic Claude Code 团队工程师 Thariq Shihipar 的主张——HTML 才是更好的 AI 输出格式。Shihipar 上周在 X 平台发文称「HTML is the new markdown」,附上 20 个实际使用范例,浏览量突破 440 万次。Karpathy 不仅同意这一判断,还将话题从格式选择提升到 AI 输出终极形态的讨论。
从 Markdown 到 HTML,再到互动式神经影像
Karpathy 列出 AI 输出格式的演进路线。第一代是原始纯文字,阅读费力;第二代是当前主流的 Markdown,靠粗体、斜体、表格稍微降低认知负担;第三代是 HTML,排版、图形甚至互动元件���自由度远超 Markdown,这一代正快速成为新预设。他认为 HTML 之后还有多代中间形态(第 4、5、6 代),但不必急着定义。
终点(第 n 代)是由扩散模型直接生成的互动式神经影像或模拟。AI 不再输出人类阅读的文字,而是直接输出到人脑,让人感知动态画面。Karpathy 解释,人脑约 1/3 是视觉并行处理器,视觉通道是信息进入大脑的「十车道高速公路」,频宽远超阅读文字。因此高带宽视觉输出(影像、动画、影片)才是人机交互的最优解。
Flipbook 原型:不写一行代码的实时神经网络界面
Karpathy 直接点名前 OpenAI 研究员 Zain Shah 团队发布的 Flipbook 原型作为终局雏形。Flipbook 完全不使用 HTML 或 CSS,而是基于开源 DiT(Diffusion Transformer)影片模型 LTX Studio,通过 WebSocket 实时串流 1080p、24fps 的像素级画面。用户看到的每个「页面」都是 AI 实时生成的影像,点击任意区域就生成下一帧,整个界面没有一行传统代码。
Karpathy 强调,AI 输出最终需要从人类的视觉转向人类的「感知」。但作为眼前最务实的建议,他直接建议 LLM 用户在提示词末尾加上「structure your response as HTML」���然后用浏览器打开生成的文件。

