DeepSeek近日宣布推出一项名为“视觉原语”(Visual Primitives)的新型多模态技术,旨在从根本上提升人工智能的空间推理能力。与传统方法专注于提高图像分辨率不同,DeepSeek将边界框(bounding boxes)和点(points)作为基本推理单元,使AI模型能够在推理过程中“指向”具体物体,从而有效解决多模态推理中的“参考鸿沟”(Reference Gap)——即仅靠语言无法精确描述空间关系的问题。
技术核心:压缩稀疏注意力机制
该公司强调,其采用的压缩稀疏注意力机制(Compressed Sparse Attention)能够显著减少处理图像时所需的token数量,从而加快推理速度并降低内存占用。这一突破对于实时应用场景至关重要,例如机器人视觉和自动驾驶。在加密领域,类似的高效推理能力可被用于链上交易分析、智能合约自动化执行中的图像识别,以及去中心化物理基础设施网络(DePIN)中的设备视觉判断。
潜在应用与加密AI叙事
尽管DeepSeek坦言当前技术仍面临触发词依赖(trigger word dependency)和分辨率限制等挑战,但视觉原语的推出为AI与加密世界的融合提供了新想象空间。目前,加密市场中的AI代理(AI Agent)代币、去中心化计算网络等赛道正加速发展,DeepSeek所展示的轻量级空间推理方案或将成为这些项目的关键底层技术组件。此外,在元宇宙和链游场景中,更精准的空间理解也能提升虚拟资产交互的真实感。
局限与未来方向
DeepSeek在报告中指出,未来将致力于消除触发词依赖,并探索更高分辨率下的压缩策略。业内人士认为,若该技术能通过开源方式与区块链社区共享,将极大促进加密原生AI应用的开发效率。目前,已有多个DePIN项目关注视觉原理的商业化落地,预计2026年下半年将见到首批集成案例。

