DeepSeek推出视觉原语技术,突破AI空间推理瓶颈,或推动加密AI应用落地

DeepSeek推出视觉原语技术,突破AI空间推理瓶颈,或推动加密AI应用落地

N
News Editor 01
2026-07-10 15:00:13
DeepSeek发布基于视觉原语的多模态AI技术,通过边界框和点作为基本推理单元,大幅提升空间推理准确率,降低token消耗。该技术有望赋能加密领域的AI代理、DePIN和自动驾驶等场景。
DeepSeek视觉原语AI空间推理加密AIDePIN

DeepSeek近日宣布推出一项名为“视觉原语”(Visual Primitives)的新型多模态技术,旨在从根本上提升人工智能的空间推理能力。与传统方法专注于提高图像分辨率不同,DeepSeek将边界框(bounding boxes)和点(points)作为基本推理单元,使AI模型能够在推理过程中“指向”具体物体,从而有效解决多模态推理中的“参考鸿沟”(Reference Gap)——即仅靠语言无法精确描述空间关系的问题。

技术核心:压缩稀疏注意力机制

该公司强调,其采用的压缩稀疏注意力机制(Compressed Sparse Attention)能够显著减少处理图像时所需的token数量,从而加快推理速度并降低内存占用。这一突破对于实时应用场景至关重要,例如机器人视觉和自动驾驶。在加密领域,类似的高效推理能力可被用于链上交易分析、智能合约自动化执行中的图像识别,以及去中心化物理基础设施网络(DePIN)中的设备视觉判断。

潜在应用与加密AI叙事

尽管DeepSeek坦言当前技术仍面临触发词依赖(trigger word dependency)和分辨率限制等挑战,但视觉原语的推出为AI与加密世界的融合提供了新想象空间。目前,加密市场中的AI代理(AI Agent)代币、去中心化计算网络等赛道正加速发展,DeepSeek所展示的轻量级空间推理方案或将成为这些项目的关键底层技术组件。此外,在元宇宙和链游场景中,更精准的空间理解也能提升虚拟资产交互的真实感。

局限与未来方向

DeepSeek在报告中指出,未来将致力于消除触发词依赖,并探索更高分辨率下的压缩策略。业内人士认为,若该技术能通过开源方式与区块链社区共享,将极大促进加密原生AI应用的开发效率。目前,已有多个DePIN项目关注视觉原理的商业化落地,预计2026年下半年将见到首批集成案例。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。