DeepSeek(深度求索)是来自中国杭州的 AI 团队。2025 年 1 月,公司用一款号称训练成本极低的开源模型 R1 引发市场震动,英伟达(Nvidia)单日市值蒸发 5,890 亿美元,这一事件一度被市场称为“DeepSeek 时刻”。一年多后,DeepSeek 推出 2026 年新旗舰 V4,并完成约 70 亿美元融资。围绕这家公司,外界关注的焦点集中在团队背景、模型迭代、使用方式、开放程度,以及隐私和地缘争议。
DeepSeek 来自哪里
DeepSeek 成立于 2023 年 7 月,由中国量化对冲基金幻方量化(High-Flyer)分拆而来。幻方量化成立于 2015 年,依靠自建 GPU 集群开展量化交易,也因此积累了训练大模型所需的算力基础。
创始人兼 CEO 梁文锋同时也是幻方量化 CEO,并通过持股实体持有 DeepSeek 约 84% 股权。公司总部位于杭州,团队规模保持精简,2025 年时约 160 人,整体偏研究导向,没有把商业化放在最前面,而是从一开始就把目标放在通用人工智能(AGI)。
在 2026 年首轮融资完成后,梁文锋身价据估翻倍至约 360 亿美元,一度被称为全球最富有的 AI 创始人。
R1 引爆“DeepSeek 时刻”
2025 年 1 月 20 日,DeepSeek 发布主打推理能力的 R1。该模型的性能对标 OpenAI 的 o1,同时宣称训练所用算力远低于同业。市场反应很快传导到美股。1 月 27 日,英伟达单日市值蒸发 5,890 亿美元,创下美国股市单一公司最大单日跌幅,股价下跌约 17%。同一天,DeepSeek 还超过 ChatGPT,登上美国 iOS 免费 App 排行第一。
外界最常提到的“训练成本仅 560 万美元”,实际出自 DeepSeek V3 技术报告,指的是最后一次正式训练的算力成本,大约使用 2,048 张 H800 GPU,运行约 55 天,并不包含更早期的研究、实验、数据和人力投入。半导体研究机构 SemiAnalysis 估计,DeepSeek 累计 GPU 资本支出可能高达约 5 亿美元。也就是说,560 万美元这个数字对应的是较窄口径的边际算力成本,不等于 DeepSeek 的全部投入。
模型路线从 R1 走向 V4
DeepSeek 的模型大致分为两条路线:一条是以 V 命名的通用模型,另一条是以 R 命名、强调推理能力的模型。自 2024 年的 V2、V3 起,到 2025 年 1 月引发广泛关注的 R1,DeepSeek 持续把“思考”能力并入主线模型。
2025 年 8 月发布的 V3.1 首次采用混合思考架构,年底推出的 V3.2 又引入稀疏注意力(DSA),用来提升长文本处理效率。此前外界一度流传 DeepSeek 会单独推出 R2,但最终没有独立发布,推理能力被并入 V3.1 到 V4 这一混合路线中。完整版本可参考 DeepSeek 官方更新记录。
到了 2026 年,这两条路线被整合进新旗舰 V4。V4 内置可选的“思考模式”,把过去由 R1 负责的推理任务也吸收进来。4 月 24 日,V4 以预览版形式亮相,分为性能更强的 V4-Pro 和轻量版 V4-Flash,两者都支持 100 万 token 上下文长度,可以一次处理整套代码库或长篇文档。7 月 31 日,DeepSeek 推出 V4-Flash 正式版,强化自主代理(agent)能力,并再次下调 API 价格;截至 8 月初,更大的 V4-Pro 正式版仍处于预览阶段。
V4 最受关注的是效率。根据《麻省理工科技评论》,V4-Pro 仅需上一代 V3.2 约 27% 的算力和 10% 的内存,V4-Flash 则压到 10% 算力和 7% 内存。性能方面,DeepSeek 称 V4-Pro 可与 Anthropic 的 Claude Opus 4.6、OpenAI 的 GPT-5.4 以及 Google 的 Gemini 3.1 等顶级闭源模型并驾齐驱,不过这些跑分由 DeepSeek 自行公布,应视为厂商说法。V4 也针对华为升腾(Ascend)等中国国产芯片做了优化。
用户如何使用 DeepSeek
普通用户最直接的方式,是使用官方网页 chat.deepseek.com,或下载 DeepSeek 手机 App。其界面与 ChatGPT 接近,支持免费对话,也可以开启深度思考模式。
开发者主要通过 API 接入。以官方公布价格为例,V4-Flash 每百万 token 输入约 0.14 美元、输出约 0.28 美元;V4-Pro 输入约 0.44 美元、输出约 0.87 美元,命中缓存时价格还会更低。按文中说法,这样的定价通常只有同级美国闭源模型的几分之一,也是其在开发者群体中快速普及的重要原因。
由于 DeepSeek 开放模型权重,进阶用户也可以把模型下载到本地运行,例如通过 Ollama 在自己的电脑或服务器上部署,这样数据不必上传到云端。完整 V4 模型体积较大,需要高性能硬件支持,但 DeepSeek 也发布了多个更小的蒸馏版本,让一般硬件也能尝试使用。
开放权重与授权安排
自 2025 年 1 月起,DeepSeek 的模型权重采用较宽松的 MIT 授权开放,允许商用和再训练,这也是它被大规模采用的原因之一。
不过严格来说,DeepSeek 属于“开放权重(open-weight)”,并非完全意义上的“开源”。它公开了模型权重和技术报告,但没有公开训练数据和完整训练流程。为了让更多设备可用,DeepSeek 还把 R1 的推理能力蒸馏到 1.5B 至 70B 不等的小模型中,这些模型分别基于 Qwen 和 Llama,适合本地设备或边缘设备运行。
2026 年融资进展与梁文锋的算力表述
2026 年 6 月,DeepSeek 完成首轮约 70 亿美元外部融资,投资方包括腾讯、电池厂商宁德时代(CATL),以及有官方背景的国家人工智能产业投资基金,公司估值达到约 3,500 亿元人民币。
之后,公司启动第二轮融资,目标至少募资 100 亿元人民币,投前估值一度上看约 4,800 亿元人民币。不过这轮融资在 7 月暂停。触发点是一场投资人会议的谈话记录外流。梁文锋在会上把中国 AI 与美国的差距归因于算力,而不是人才。根据《第一财经》取得的会议记录,他表示:“我们与美国最大的差距在于资源。”
梁文锋还称,DeepSeek 手中拥有相当于约 2 万张英伟达 H 系列 GPU 的算力,并与华为深度合作,通过自研 TileLang 等工具绕开英伟达 CUDA 生态。管理层因非公开言论外流感到受挫,随后口头通知投资人暂缓签约,但后续仍可能重启。公司也在筹备最快于 2026 年底提出的 IPO。
围绕 DeepSeek 的主要争议
与 DeepSeek 相关的争议主要集中在三方面。
- 数据隐私。 DeepSeek 的隐私政策写明,用户数据储存在中国境内服务器,内容包括输入文本、IP 地址、上传文件,甚至打字模式。原文还提到,中国政府对境内企业数据具有广泛的法律调取权。
- 内容审查。 托管版模型在天安门、台湾等政治敏感议题上,可能拒绝回答,或给出更接近中国官方立场的回应。
- 各国限制公部门使用。 意大利在 2025 年 1 月因数据疑虑将其下架;美国通过国防授权法及相关法案,禁止联邦设备使用,范围覆盖 NASA、海军、五角大楼、商务部等机构;台湾地区数字发展部门也在 2025 年 1 月底要求公部门、国营事业和公立学校不得使用。澳大利亚、韩国、印度也有类似限制。
此外,2025 年 1 月,OpenAI 与微软表示正在调查是否有与 DeepSeek 相关的团体通过 OpenAI API“蒸馏”并不当获取数据;2026 年也出现 Anthropic 指控 DeepSeek 大量抓取 Claude 对话的报道。这些内容目前仍属指控,公开层面没有定论,但争议也持续围绕其数据来源的正当性展开。
与 Claude、ChatGPT、Gemini 的定位差异
与 OpenAI 的 GPT、Anthropic 的 Claude、Google 的 Gemini 这些闭源旗舰模型相比,DeepSeek 的定位较为明确:开放权重、价格低,并在编程、数学和代理任务的跑分上主打接近前沿模型,但成本低一个量级。
不过,文中提到的这类对标顶级模型的性能数字,大多来自 DeepSeek 自行公布的结果,应视作厂商说法,而非独立验证。对开发者来说,DeepSeek 更适合成本敏感、希望自行部署,或希望减少单一供应商绑定的场景;如果处理的数据涉及隐私或合规要求,则还需要把“数据存储在中国”以及各国公部门限制一并纳入考量。
从文中给出的判断看,DeepSeek 已是当前开放权重阵营中分量较重的选择之一,但具体用于哪些场景、处理哪些数据,仍需要分别评估。
文中列出的几个常见问题
DeepSeek 是哪国公司
DeepSeek 来自中国,总部位于杭州,于 2023 年 7 月由量化对冲基金幻方量化分拆成立。
DeepSeek 能否免费使用
可以。网页版和手机 App 提供免费对话;开发者通过 API 按用量计费,单价较低;模型权重也可下载到本地运行。
DeepSeek 最新模型是什么
截至文中时间点,最新模型是 2026 年的 V4 家族。轻量版 V4-Flash 已在 7 月底推出正式版,V4-Pro 截至 8 月初仍处于预览阶段。
训练成本是否真的只有 560 万美元
这一数字对应的是 V3 最后一次正式训练的算力成本,不包括研发、实验和人力。SemiAnalysis 估计,其 GPU 资本支出可能达到约 5 亿美元。
使用 DeepSeek 是否安全,数据是否会存放在中国
托管版会把数据存放在中国境内服务器,多国也因此限制其公部门使用。若用户更在意隐私,文中给出的替代方式是使用开放权重进行本地部署,避免数据外流。

