在生成式AI持续向物理世界延伸的背景下,初创公司Memories.ai正试图补上一个关键短板:让机器不仅能够“看见”,还能像人类一样对所见内容进行持续、可检索的记忆。该公司近日在英伟达GTC大会上披露,其正构建面向下一代可穿戴设备和机器人的“视觉记忆层”,希望为具身智能提供底层基础设施。
从行业发展路径看,过去一轮AI“记忆”能力升级主要集中于文本侧,例如聊天机器人保存用户偏好、对话上下文与历史信息等。但Memories.ai认为,真正进入现实世界的AI系统,面对的并不是结构化文本,而是连续不断、维度极高的视频和视觉流。对于机器人、智能眼镜、仓储自动化设备等硬件而言,能否记住场景、物体位置和空间关系,直接决定其理解环境与执行任务的能力。
从Meta智能眼镜项目中发现机会
Memories.ai的创立,源于联合创始人兼CEO Shawn Shen与CTO Ben Zhou此前参与Meta Ray-Ban智能眼镜AI系统开发时的真实痛点。两人发现,设备虽然可以录制视频,但AI并没有一种高效且结构化的方式,去理解、索引并在用户需要时调用这些影像内容。换言之,机器能够拍下来,却无法真正“记住”。
在尝试寻找市场现成方案未果后,团队选择从Meta体系中独立出来创业,专注构建这一能力层。这一判断反映出AI产业一个正在成形的趋势:当模型能力不断提升后,决定终端体验上限的,可能不再只是推理性能,而是长期记忆、检索与上下文回溯能力。
与英伟达合作,搭建视觉记忆基础设施
根据公开信息,Memories.ai在此次合作中接入了英伟达的两项核心能力:其一是视觉语言推理模型Cosmos Reason 2,其二是用于视频搜索与摘要的应用框架Nvidia Metropolis。两者结合后,可支持设备把��续视觉数据转化为可搜索、可调用的记忆片段,从而提升后续检索、总结和推理效率。
这类基础设施的意义在于,它并非服务单一应用,而是可成为未来多种硬件平台的“中间层”。无论是需要理解作业环境的仓储机器人,还是需要帮助用户找回几天前看过文件的AI眼镜,都依赖同一类底层能力:将视觉内容嵌入、索引、存储,并在恰当时刻完成召回。
视觉记忆为何比文本记忆更难
与文本记忆相比,视觉记忆的技术门槛明显更高。文本天然具备语言结构,更容易被切分、标注和建立索引;但视频由大量连续帧构成,包含物体、动作、场景变化和空间关系等多重信息,属于典型的非结构化高维数据。这意味着系统不仅要“看到”物体,还要理解它在时间与空间中的变化轨迹。
对于具身AI而言,这种能力又是不可回避的。一个在仓库中作业的机器人,需要记住工具最后一次出现的位置;一副全天佩戴的智能眼镜,则要能帮助用户快速回忆某份文档、某次会面或某件物品曾出现的时间与地点。正因如此,视觉记忆被视为推动AI从数字空间走向现实世界的重要桥梁。
LVMM模型与LUCI硬件协同推进
为了搭建这一层能力,Memories.ai采取了“模型+数据采集”双线推进策略。公司在2025年7月推出了自研的Large Visual Memory Model(LVMM),定位为面向视觉序列索引与检索的专用模型。按照公司表述,其能力可以被理解为更偏视觉记忆场景的多模态嵌入系统。
在训练数据方面,Memories.ai还开发了一款名为LUCI的定制硬件设备,供专门的数据采集团队佩戴,用于记录第一人称视频数据。公司强调,打造这款设备并非为了转型硬件厂商,而是因为现成消费级录像设备大多围绕高清回放与电池续航设计,并不适合长时间、连续且高效率地采集训练数据。对视觉记忆模型而言,数据获取方式本身就是核心壁垒之一。
融资与商业合作同步展开
自2024年成立以来,Memories.ai已累计获得1600万美元融资,其中包括800万美元种子轮和由Susa Ventures领投的800万美元扩展轮,Seedcamp与Fusion Fund亦参与投资。对于一家仍处在底层能力建设阶段的创业公司而言,这一融资规模显示出资本市场对“物理世界AI基础设施”方向的持续关注。
在产业合作方面,Memories.ai在发布第二代LVMM后,又与高通达成合作,推动相关模型在高通处理器上运行。这意味着其视觉记忆能力未来有望更高效地下沉至终端设备,而不仅仅停留在云端。公司同时透露,已与多家大型可穿戴设备企业展开合作,但并未公开具体名称。
市场影响:具身智能基础层竞争升温
从市场角度看,Memories.ai所切入的并不是短期爆款应用,而是更底层的基础设施赛道。其商业逻辑与大模型时代的“存储层”“向量检索层”有相似之处,只不过服务对象从文本与知识库,扩展到了视频、场景和现实世界互动。若该能力成熟,受益范围可能覆盖机器人、AR眼镜、工业巡检、医疗辅助和家庭服务等多个领域。
对产业链而言,英伟达与高通的出现也释放出一个信号:芯片与平台厂商正加速押注具身AI所需的新型能力栈。未来竞争或不只在模型参数规模,而在于谁能更有效地处理连续视觉流、长期记忆与本地推理。这对可穿戴设备和机器人厂商来说,意味着产品差异化空间可能从硬件配置转向“是否真正懂用户所处环境”。
不过,Memories.ai管理层也保持了相对克制的商业预期。Shawn Shen表示,公司当前更聚焦模型与基础设施本身,而非急于押注尚未完全成熟的消费级市场。这表明视觉记忆虽然前景广阔,但大规模商业化仍取决于终端硬件渗透率、设备功耗、隐私治理与用户接受度等多重因素。
总体来看,Memories.ai正在尝试解决具身智能最核心的问题之一:如何让机器对现实世界形成可用、可调用、可持续更新的视觉记忆。随着英伟达和高通等产业伙伴加入,这一“视觉记忆层”有望成为未来AI眼镜与机器人生态中的关键底座。对整个AI与硬件融合市场而言,这不仅是一项技术突破方向,也可能预示着下一阶段基础设施竞争的重点已经从“会不会看”转向“能不能记住”。

