3月12日,Google Research正式公开了一项名为“Groundsource”的创新技术框架。该框架的核心是调用旗下旗舰大语言模型Gemini,将海量且非结构化的全球新闻报导自动转化为结构化的历史灾害数据。首批开源的资料库包含全球150多个国家、总计260万笔城市山洪爆发记录,为气候研究与灾害预警系统奠定了关键的数据基础。
全球数据稀缺痛点:Groundsource的破局逻辑
每年自然灾害造成数百万人受灾与数十亿美元经济损失。Google科学家在官方部落格中指出,推进气候研究、建立精准水文模型并提供及时预警,首先需要“稳健的历史基准数据”。然而现实是全球真实灾害数据极度匮乏,且散落于各类文档中。Groundsource框架正是为了解决这一短板而设计——它通过Gemini强大的自然语言处理能力,从新闻报导、网络信息中精准提取经过验证的“真实地面数据”,以高精度绘制灾害历史足迹。这套方法不依赖人工标注,可大规模扩展。
首个开源资料库:150国260万笔城市山洪记录
作为Groundsource的首个实战成果,Google团队释出了一个专注于“城市山洪爆发”的开源资料库。资料库覆盖150多个国家,总额度达到260万笔历史洪水事件。Google表示该资料库已完全开源,旨在为全球科学家与机构提供可靠的数据源,帮助各国政府在城市规划、保险评估与紧急灾害应变上做出更准确决策。值得一提的是,这260万笔记录并非来自官方统计,而是Gemini从全球新闻中自动萃取并去重验证的结果,这在精度和覆盖范围上都是前所未有。
未来扩展:从洪水到地震、野火
这项突破不仅体现了Google应对气候危机的战略投入,也为生成式AI的“非生成类”应用设立了新标准。Google团队强调,Groundsource的方法论具有高度可扩展性,未来可应用于建立地震、野火等其他灾害的历史资料库。当全世界面临越来越极端的气候变迁���AI从新闻中“读取”过去,或许能帮人类更好地预报未来。

