在持续扩招算法、研发、产品、运维、数据工程师及职能岗位的同时,DeepSeek 也迎来新的核心研究人才。公开信息显示,清华大学 2021 级博士生、2025 年研究生特等奖学金获得者顾煜贤已正式加入 DeepSeek。此前,在 DeepSeek V4 论文作者名单中,已出现其名字;而 DeepSeek V4 正式版则计划于本月中旬上线。

顾煜贤学术背景与研究方向
顾煜贤是清华大学计算机系毕业年级博士生,本科同样毕业于清华大学,师从黄民烈教授,长期在清华大学交互式人工智能课题组(Conversational AI, CoAI)开展研究。他曾获得 2025 年度苹果博士奖学金和蚂蚁 In-Tech 奖学金。顾煜贤表示,硬件资源受限时,算法创新是突破计算瓶颈的关键,这一判断也构成了其研究工作的主线。

其研究主要围绕大语言模型全生命周期的效率提升,覆盖预训练、下游适配和推理等关键阶段,近期主要聚焦三个方向:

- 预训练数据筛选:通过理论与算法优化训练中的数据选择过程,代表工作包括 PDS、Instruction Pre-training 和 Learning Law。
- 知识蒸馏:将大模型能力迁移至更小、更易部署的模型,代表成果包括 MiniLLM 和 MiniPLM。
- 高效模型架构:在降低计算成本的同时提升模型性能,相关工作包括 Jet-Nemotron。
论文影响力与代表性成果
根据其 Google Scholar 页面,顾煜贤论文总引用量已接近5000 次。其中,引用超过 1000 次的论文有两篇,分别是《Pre-trained models: Past, present and future》和《MiniLLM: Knowledge distillation of large language models》。此外,他还以第一作者身份多次在 NeurIPS、ICLR、ACL 等国际 AI 顶会发表论文。
在模型压缩方向,顾煜贤及其合作者于 2024 年提出 MiniLLM 方法,核心是以反向 Kullback-Leibler 散度替代传统知识蒸馏中的正向 KLD 目标,并进一步推导出对应的高效优化方案。论文实验显示,在指令跟随任务中,MiniLLM 相比基线方法可生成更准确、整体质量更高的回答,同时具备更低曝光偏差、更好的校准能力,以及更强的长文本生成表现。原文称,谷歌、阿里、英伟达等开源社区和产业平台已采用这一方法。

Jet-Nemotron 指向高效推理路线
在模型架构方向,顾煜贤参与的 Jet-Nemotron 是一类混合架构语言模型。其核心创新包括两项:一是 Post Neural Architecture Search(PostNAS),即一种适用于任意预训练 Transformer 模型的后训练架构探索与自适应 pipeline;二是 JetBlock,一种新的线性注意力模块,原文称其性能显著优于 Mamba2 等既有设计。

按照文中披露的数据,2B 版本的 Jet-Nemotron 在性能上已超过 Qwen3、Qwen2.5、Gemma3 和 Llama3.2 等开源全注意力语言模型,同时实现显著效率提升。在 H100 GPU、上下文长度 256K 且最大 batch size 条件下,其生成吞吐量最高可达到53.6 倍加速。在 MMLU 和 MMLU-Pro 基准上,该模型的准确率也超过了部分参数规模更大的 MoE 全注意力模型,包括 DeepSeek-V3-Small 和 Moonlight。

随着 DeepSeek 持续补强模型研发团队,并推进 DeepSeek V4 正式版发布,顾煜贤的加入被视为公司在大模型效率优化、模型压缩和高效架构方向上的一次人才补充。就目前披露的信息看,其既有研究成果与 DeepSeek 当前模型迭代节奏存在较高契合度。

