a16z 合伙人 Joe Schmidt 把 AI 应用市场分成两块:一块是 OpenAI、Anthropic 等大模型公司正在正面推进的“黄砖路”,另一块是更复杂的垂直行业场景。他的判断很直接,真正适合创业公司长期经营的,不是代码生成、写作、图像生成、通用 Agent 和���向办公助手,而是那些嵌入企业真实流程、承担合规责任、能对业务结果负责的系统。
他指出,企业愿意持续付费的对象,并不是一个更聪明的聊天窗口,而是能够处理混乱数据、多方审批、边界案例、审计要求的完整系统。底层模型会持续变强,也会越来越容易替换;相对难被替换的,是围绕具体行业沉淀下来的数据、流程、治理能力和运营记忆。短句说,就是应用层并没有被“一把吃光”。
“黄砖路”为什么危险
在 Joe Schmidt 看来,最显眼的机会往往也是最危险的机会。很多创业团队的做法,是接入 Google Drive、Slack、Salesforce、Notion、GitHub 等连接器,再叠加一个智能体编排层,做出横向工具产品。这类产品看上去炫目,但它与大模型公司的路线高度重合。
问题不只在竞争激烈。更关键的是,大模型公司既掌握模型本身,也掌握分发能力、利润空间和产品架构选择权。像 Codex、Claude Code 这类产品所覆盖的,正是低步骤、横向、通用的工作任务。若创业公司采用相同打法,却没有更深的子智能体配置、行业数据��累或独立分发渠道,很容易被挤压成一层很薄的包装。
Joe Schmidt 还提到,OpenAI 和 Anthropic 自己也在用行动说明问题:它们并没有靠“一个通用 AI 同事”去解决所有企业需求,而是宣布投入大规模前线部署式合资项目,为企业做模型配置和定制。如果下一次模型更新就能直接解决复杂业务问题,这类投入就没有必要。
垂直工作流才是应用公司的防线
他给出的方向,是走进“奥兹国的其他地方”——也就是深入垂直行业、复杂工作流和多系统协同的区域。在这些场景里,价值不只来自模型能力,还来自模型外围的脚手架:上下文收集、任务路由、权限控制、审计记录、护栏设计、遗留系统对接,以及把结果稳定送进生产环境的工程能力。
这种场景通常需要处理一个现实问题:真实业务不是一次提示词就能跑通。它可能跨越多个系统,要求确定性结果,容错空间很小,还直接绑定某个商业结果。大模型公司当然知道这些需求有价值,但它们难以长期扎进每个行业的日常流程里,把那些没有文档记录的行业惯例、岗位经验和公司内部规则真正沉淀下来。
Joe Schmidt 认为,这里会形成两类积累。一类是跨客户的模式识别,见过的案例越多,对问题形态的理解越深;另一类是客户内部积累,只有在真实使用中,系统才能学到企业为何做出某个决策、哪些例外经常出现、哪些规则从未被明确写下。这样的知识,往往不在公开互联网,也不在通用训练集中。
护栏、路由和迁移成本构成壁垒
文章还强调了三个经常被低估的点。第一是护栏。不同产业、不同岗位,对智能体可接触的数据、可执行的动作、可输出的内容要求完全不同。法律场景要面对执业规范,医疗场景要面对 HIPAA,金融场景则牵涉 SEC、FINRA 以及州级保险监管。横向产品很难同时把这些约束做深。
第二是模型路由。Joe Schmidt 认为,优秀的应用公司不会把所有请求都丢给同一类前沿模型,而是按子任务选择最合适的模型:最难的任务调用前沿模型,大部分任务交给中等模型,能验证稳定性的环节再用更小的定制模型或微调模型。这样做不是噱头,而是成本结构。文中直言,把每个查询都交给 Opus 4.7,是让毛利率转负的最快路径。
第三是迁移能力。大模型公司会持续发布新模型,但通常不会替客户承担上线切换、提示词重校、边界案例测试和生产环境平滑迁移的工作。垂直应用公司若愿意吸收这些复杂成本,客户买到的就是连续性,而不是一次性调用接口。
11x与FurtherAI给出的行业例子
为说明这种机会不是抽象概念,文中还引入了 11x CEO Prabhav Jain 和 FurtherAI CEO Aman Gour 的经验。Prabhav Jain 介绍,11x 把目标定义为帮助企业创造更多销售线索和销售管道,然后再拆成一连串具体任务,包括基于自定义信号挖掘潜在客户、补全客户信息、抓取 CRM 上下文、撰写不同渠道信息、判断客户资格以及邮件送达系统。这里面有些适合智能体,有些则更偏确定性软件工程。
他提到,真实工作流里大致有一半并不是智能体任务,这部分并不会天然给大模型公司带来优势。另一个难点是数据混乱。比如一家公司已经是客户,就不该再向这家公司的人发送冷启动销售邮件;但现实里,母公司与子公司域名、CRM 记录、过时字段都可能导致误判。11x 的做法,是围绕问题本身设计专门系统,而不是把���个通用副驾直接接到 CRM 上。
Prabhav Jain 还披露,尽管市场对“AI 写的邮件”和“更像人写的邮件”的判断会持续变化,11x 的积极回复率在过去几个月里提高了 4 倍,并为客户创造了数亿美元的销售管道。在另一项与一家《财富》1000 强机构的合作中,11x 通过语音向其 SMB 客户群进行经同意的外呼,当前每天创造的销售机会数量,已经超过该机构整个销售团队在该细分市场一个月的产出。
FurtherAI 的观察则来自保险运营。Aman Gour 认为,保险行业很多“智能”本身就藏在工作流里,而不是单独存在于模型中。两家保险公司表面上的流程都可能是提交、审核、报价、承保,但真正决定结果的,是风险何时升级、哪些损失信号重要、冲突规则如何排序、何时必须由人工签字、调用哪些外部数据,以及最终决策怎样被记录。
这些逻辑往往分散在标准操作流程、管理审核、核保哲学、公司风险偏好和多年运营经验中,很多内容并没有被写成可直接读取的规则。FurtherAI 因此选择构建“智能体工作流”:工作流负责可重复性、可审计性和成本控制,智能体处理变化和异常,人类保留在判断和问责环节。Aman Gour 的结论很明确,第一天交付的工作流不是护城河,真正的壁垒来自系统在生产环境中被重复运行后形成的运营记忆。
客户买的是结果,不是基准分
Joe Schmidt 最后给出的区分标准也很直白:大模型公司的表现,通常用基准测试衡量;垂直应用公司的表现,最终要在客户损益表里体现。客户不会因为某个模型在 SWE-Bench 或 MMLU 上分数更高就付钱,他们关心的是系统有没有成交订单、有没有改对合同红线、有没有承保正确的保单。
如果产品卖的是通用能力,它更容易被 Claude 或 Codex 这类席位产品替代;如果产品已经成为客户执行工作的系统,负责数据捕捉、流程编排、治理和合规,它就更难被拿走。Joe Schmidt 的核心观点是,模型会继续赢下“黄砖路”,但下一代企业软件,更可能在那条主路之外长出来。

