Memories.ai Teams Up With Nvidia to Build a Visual Memory Layer for Wearables and Robots

Memories.ai Teams Up With Nvidia to Build a Visual Memory Layer for Wearables and Robots

N
News Editor 01
2026-07-07 05:32:31
Memories.ai unveiled its visual memory infrastructure strategy at Nvidia GTC, aiming to help wearables and robots remember what they see. The startup has raised $16 million and is also working with Qualcomm to bring the technology to edge devices.

在生成式AI持续向物理世界延伸的背景下,初创公司Memories.ai正试图补上一个关键短板:让机器不仅能够“看见”,还能像人类一样对所见内容进行持续、可检索的记忆。该公司近日在英伟达GTC大会上披露,其正构建面向下一代可穿戴设备和机器人的“视觉记忆层”,希望为具身智能提供底层基础设施。

从行业发展路径看,过去一轮AI“记忆”能力升级主要集中于文本侧,例如聊天机器人保存用户偏好、对话上下文与历史信息等。但Memories.ai认为,真正进入现实世界的AI系统,面对的并不是结构化文本,而是连续不断、维度极高的视频和视觉流。对于机器人、智能眼镜、仓储自动化设备等硬件而言,能否记住场景、物体位置和空间关系,直接决定其理解环境与执行任务的能力。

从Meta智能眼镜项目中发现机会

Memories.ai的创立,源于联合创始人兼CEO Shawn Shen与CTO Ben Zhou此前参与Meta Ray-Ban智能眼镜AI系统开发时的真实痛点。两人发现,设备虽然可以录制视频,但AI并没有一种高效且结构化的方式,去理解、索引并在用户需要时调用这些影像内容。换言之,机器能够拍下来,却无法真正“记住”。

在尝试寻找市场现成方案未果后,团队选择从Meta体系中独立出来创业,专注构建这一能力层。这一判断反映出AI产业一个正在成形的趋势:当模型能力不断提升后,决定终端体验上限的,可能不再只是推理性能,而是长期记忆、检索与上下文回溯能力。

与英伟达合作,搭建视觉记忆基础设施

根据公开信息,Memories.ai在此次合作中接入了英伟达的两项核心能力:其一是视觉语言推理模型Cosmos Reason 2,其二是用于视频搜索与摘要的应用框架Nvidia Metropolis。两者结合后,可支持设备把��续视觉数据转化为可搜索、可调用的记忆片段,从而提升后续检索、总结和推理效率。

这类基础设施的意义在于,它并非服务单一应用,而是可成为未来多种硬件平台的“中间层”。无论是需要理解作业环境的仓储机器人,还是需要帮助用户找回几天前看过文件的AI眼镜,都依赖同一类底层能力:将视觉内容嵌入、索引、存储,并在恰当时刻完成召回。

视觉记忆为何比文本记忆更难

与文本记忆相比,视觉记忆的技术门槛明显更高。文本天然具备语言结构,更容易被切分、标注和建立索引;但视频由大量连续帧构成,包含物体、动作、场景变化和空间关系等多重信息,属于典型的非结构化高维数据。这意味着系统不仅要“看到”物体,还要理解它在时间与空间中的变化轨迹。

对于具身AI而言,这种能力又是不可回避的。一个在仓库中作业的机器人,需要记住工具最后一次出现的位置;一副全天佩戴的智能眼镜,则要能帮助用户快速回忆某份文档、某次会面或某件物品曾出现的时间与地点。正因如此,视觉记忆被视为推动AI从数字空间走向现实世界的重要桥梁。

LVMM模型与LUCI硬件协同推进

为了搭建这一层能力,Memories.ai采取了“模型+数据采集”双线推进策略。公司在2025年7月推出了自研的Large Visual Memory Model(LVMM),定位为面向视觉序列索引与检索的专用模型。按照公司表述,其能力可以被理解为更偏视觉记忆场景的多模态嵌入系统。

在训练数据方面,Memories.ai还开发了一款名为LUCI的定制硬件设备,供专门的数据采集团队佩戴,用于记录第一人称视频数据。公司强调,打造这款设备并非为了转型硬件厂商,而是因为现成消费级录像设备大多围绕高清回放与电池续航设计,并不适合长时间、连续且高效率地采集训练数据。对视觉记忆模型而言,数据获取方式本身就是核心壁垒之一。

融资与商业合作同步展开

2024年成立以来,Memories.ai已累计获得1600万美元融资,其中包括800万美元种子轮和由Susa Ventures领投的800万美元扩展轮,Seedcamp与Fusion Fund亦参与投资。对于一家仍处在底层能力建设阶段的创业公司而言,这一融资规模显示出资本市场对“物理世界AI基础设施”方向的持续关注。

在产业合作方面,Memories.ai在发布第二代LVMM后,又与高通达成合作,推动相关模型在高通处理器上运行。这意味着其视觉记忆能力未来有望更高效地下沉至终端设备,而不仅仅停留在云端。公司同时透露,已与多家大型可穿戴设备企业展开合作,但并未公开具体名称。

市场影响:具身智能基础层竞争升温

从市场角度看,Memories.ai所切入的并不是短期爆款应用,而是更底层的基础设施赛道。其商业逻辑与大模型时代的“存储层”“向量检索层”有相似之处,只不过服务对象从文本与知识库,扩展到了视频、场景和现实世界互动。若该能力成熟,受益范围可能覆盖机器人、AR眼镜、工业巡检、医疗辅助和家庭服务等多个领域。

对产业链而言,英伟达与高通的出现也释放出一个信号:芯片与平台厂商正加速押注具身AI所需的新型能力栈。未来竞争或不只在模型参数规模,而在于谁能更有效地处理连续视觉流、长期记忆与本地推理。这对可穿戴设备和机器人厂商来说,意味着产品差异化空间可能从硬件配置转向“是否真正懂用户所处环境”。

不过,Memories.ai管理层也保持了相对克制的商业预期。Shawn Shen表示,公司当前更聚焦模型与基础设施本身,而非急于押注尚未完全成熟的消费级市场。这表明视觉记忆虽然前景广阔,但大规模商业化仍取决于终端硬件渗透率、设备功耗、隐私治理与用户接受度等多重因素。

总体来看,Memories.ai正在尝试解决具身智能最核心的问题之一:如何让机器对现实世界形成可用、可调用、可持续更新的视觉记忆。随着英伟达和高通等产业伙伴加入,这一“视觉记忆层”有望成为未来AI眼镜与机器人生态中的关键底座。对整个AI与硬件融合市场而言,这不仅是一项技术突破方向,也可能预示着下一阶段基础设施竞争的重点已经从“会不会看”转向“能不能记住”。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.