清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化

N
News Editor
2026-07-06 03:29:56
DeepSeek 在扩大招聘之际,清华大学 2021 级博士生顾煜贤已正式加入公司。公开资料显示,他曾获清华研究生特等奖学金、苹果博士奖学金和蚂蚁 In-Tech 奖学金,研究重点覆盖预训练数据筛选、知识蒸馏和高效模型架构。其代表工作包括 MiniLLM、MiniPLM 和 Jet-Nemotron,论文发表于 NeurIPS、ICLR、ACL 等顶会,部分方法已被谷歌、阿里和英伟达等采用。
DeepSeek顾煜贤大语言模型知识蒸馏Jet-NemotronMiniLLM清华大学

在持续扩招算法、研发、产品、运维、数据工程师及职能岗位的同时,DeepSeek 也迎来新的核心研究人才。公开信息显示,清华大学 2021 级博士生、2025 年研究生特等奖学金获得者顾煜贤已正式加入 DeepSeek。此前,在 DeepSeek V4 论文作者名单中,已出现其名字;而 DeepSeek V4 正式版则计划于本月中旬上线。

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 2

顾煜贤学术背景与研究方向

顾煜贤是清华大学计算机系毕业年级博士生,本科同样毕业于清华大学,师从黄民烈教授,长期在清华大学交互式人工智能课题组(Conversational AI, CoAI)开展研究。他曾获得 2025 年度苹果博士奖学金和蚂蚁 In-Tech 奖学金。顾煜贤表示,硬件资源受限时,算法创新是突破计算瓶颈的关键,这一判断也构成了其研究工作的主线。

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 3

其研究主要围绕大语言模型全生命周期的效率提升,覆盖预训练、下游适配和推理等关键阶段,近期主要聚焦三个方向:

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 4

  • 预训练数据筛选:通过理论与算法优化训练中的数据选择过程,代表工作包括 PDS、Instruction Pre-training 和 Learning Law。
  • 知识蒸馏:将大模型能力迁移至更小、更易部署的模型,代表成果包括 MiniLLM 和 MiniPLM。
  • 高效模型架构:在降低计算成本的同时提升模型性能,相关工作包括 Jet-Nemotron。

论文影响力与代表性成果

根据其 Google Scholar 页面,顾煜贤论文总引用量已接近5000 次。其中,引用超过 1000 次的论文有两篇,分别是《Pre-trained models: Past, present and future》和《MiniLLM: Knowledge distillation of large language models》。此外,他还以第一作者身份多次在 NeurIPS、ICLR、ACL 等国际 AI 顶会发表论文。

在模型压缩方向,顾煜贤及其合作者于 2024 年提出 MiniLLM 方法,核心是以反向 Kullback-Leibler 散度替代传统知识蒸馏中的正向 KLD 目标,并进一步推导出对应的高效优化方案。论文实验显示,在指令跟随任务中,MiniLLM 相比基线方法可生成更准确、整体质量更高的回答,同时具备更低曝光偏差、更好的校准能力,以及更强的长文本生成表现。原文称,谷歌、阿里、英伟达等开源社区和产业平台已采用这一方法。

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 5

Jet-Nemotron 指向高效推理路线

在模型架构方向,顾煜贤参与的 Jet-Nemotron 是一类混合架构语言模型。其核心创新包括两项:一是 Post Neural Architecture Search(PostNAS),即一种适用于任意预训练 Transformer 模型的后训练架构探索与自适应 pipeline;二是 JetBlock,一种新的线性注意力模块,原文称其性能显著优于 Mamba2 等既有设计。

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 6

按照文中披露的数据,2B 版本的 Jet-Nemotron 在性能上已超过 Qwen3、Qwen2.5、Gemma3 和 Llama3.2 等开源全注意力语言模型,同时实现显著效率提升。在 H100 GPU、上下文长度 256K 且最大 batch size 条件下,其生成吞吐量最高可达到53.6 倍加速。在 MMLU 和 MMLU-Pro 基准上,该模型的准确率也超过了部分参数规模更大的 MoE 全注意力模型,包括 DeepSeek-V3-Small 和 Moonlight。

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率优化 7

随着 DeepSeek 持续补强模型研发团队,并推进 DeepSeek V4 正式版发布,顾煜贤的加入被视为公司在大模型效率优化、模型压缩和高效架构方向上的一次人才补充。就目前披露的信息看,其既有研究成果与 DeepSeek 当前模型迭代节奏存在较高契合度。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。