开源平台 FLARE-AI 已正式上线,目标是让公众能像上报网站宕机那样,集中通报和追踪 AI 系统造成的伤害。平台全称为 Flaw Reporting for AI,构想接近 Downdetector,但监测对象不是服务故障,而是聊天机器人教人做炸弹、泄露个人信息、诱发心理伤害、输出歧视偏见或传播假信息等 AI 异���行为。
这套机制由 Hugging Face 的 AI 政策研究员 Avijit Ghosh,以及计算机科学家 Elaine Zhu、Shayne Longpre 共同推动开发。三人此前已持续研究 AI 通报机制,这次又联合 49 位 AI 专家、覆盖 32 家组织,共同发表研究论文,主张在 AI 被更广泛采用、代理型 AI 获得更高权限的阶段,缺少统一通报渠道会带来现实风险。
AI事故长期缺少统一入口
Ghosh 直言,目前几乎不存在一个集中且可追责的方式来通报 AI 系统缺陷。现阶段,AI 出现问题后往往只能由媒体零散报道,外界很难看到系统性的记录,更谈不上协调式揭露。与传统软件安全领域已经形成较成熟的漏洞披露流程相比,AI 风险通报仍很碎片化。
Center for Security and Emerging Technology 研究员 Jessica Ji 认为,现有机制确实支离破碎,而 AI 模型本身又属于黑箱系统。她将 FLARE-AI 视为一项积极尝试,理由很直接:任何能提高 AI 透明度的做法,都���现实意义。
通报范围不只限于安全漏洞
Ghosh 提到,AI 的问题并不只是一类传统意义上的资安漏洞。心理伤害、歧视偏见、假信息,同样可能构成严重后果,但不同公司对这些问题的定义并不一致,结果往往是某些事件甚至不会被正式承认发生过。没有协调式揭露机制,外部也就缺少要求透明披露的抓手。
近期案例已暴露出这种缺口。资安公司 LayerX 本周披露,一种攻击手法可以诱导内置 AI 的浏览器绕过自身护栏,包括 OpenAI 的 Atlas 和 Perplexity 的 Comet。只要让 AI 误以为自己正在玩游戏,浏览器就可能失控并尝试入侵网站。相关厂商随后已修复该问题。另在今年 4 月,资安研究员 Johann Rehberge r 还发现,可借助 ChatGPT 生成的图片诱导 Claude 泄露个人信息。
美国国会法案也在推动中央数据库
围绕 AI 缺陷通报的制度建设,也已进入立法层面。上个月,美国众议员 Deborah Ross、Jeff Hurd、Don Beyer 提出法案,要求美国国家标准暨技术研究院 NIST 制定 AI 缺陷通报标准,并维护一个中央化的 AI 缺陷通报数据库。FLARE-AI 的推动者认为,这类安排能促使开发商正视并修补系统问题,也让用户在不同使用场景下比较各家系统的安全表现。
不过,众包式通报并非没有阻力。Humane Intelligence PBC 首席执行官 Rumman Chowdhury 表示,FLARE-AI 可能为许多开发商提供可落地的通报框架,但它也会面对两个现实问题:一是如何处理大量涌入、却未必严重的报告;二是平台本身能否获得具公信力、足够权威的机构支持。FLARE-AI 眼下给出的答案,是把报告链路延伸至模型开发商,并交由长期追踪技术系统问题的非营利组织 MITRE 参与处理。

