OpenAI 解散灾难级 AI 风险评估团队,相关职能并入现有研究线
据《金融时报》报道,OpenAI 已于 7 月底解散负责评估前沿模型重大与灾难性风险的 Preparedness Team,原先集中在该团队的工作转由现有组织中的资深成员分别负责生物安全、网络安全等领域。该团队成立于 2023 年 10 月,负责未发布模型的能力测试与红队评估。此次调整延续了 OpenAI 近年将独立安全团队并入研究和产品流程的做法。

据《金融时报》报道,OpenAI 已于 7 月底解散负责评估前沿模型重大与灾难性风险的 Preparedness Team,原先集中在该团队的工作转由现有组织中的资深成员分别负责生物安全、网络安全等领域。该团队成立于 2023 年 10 月,负责未发布模型的能力测试与红队评估。此次调整延续了 OpenAI 近年将独立安全团队并入研究和产品流程的做法。

X 平台宣布开源影响「For You」推荐时间线曝光排序的相关代码,并推出「Under the Hood」透明工具,允许符合条件的用户查看过去一个月内账号或帖子是否被添加限制可见性的标签并下载数据。X 表示,这两项功能分别用于展示推荐机制和查询限流标签,目前仍处于试点阶段,仅向随机抽取的符合条件账号开放。

X宣布调整创作者分润机制,即日起停止接受旧版收益分成计划的新申请,并将在 9 月 7 日前完成过渡。9 月 8 日起,现有成员可申请新版“原创内容奖励计划”,分润依据由浏览量改为“有效展示量”。新计划要求创作者年满 18 岁、订阅 X Premium、拥有至少 500 位已验证粉丝,并在过去 90 天内取得 50 万次有效展示。平台同时明确打击搬运、剪辑拼接、机器人刷量和低质量内容。

迪士尼与 TikTok 宣布达成全球性内容共享合作,允许加入计划的创作者在短视频中使用漫威、皮克斯、星际大战等 IP 素材。双方还将把精选作品同步上线 Disney+ 新增的直式视频专区 Verts。试点将在未来几个月于美国启动,8 月 5 日先在美国上线相关专区,财务条款未披露。

Reddit 正引入依赖大语言模型的自动化审核工具 Rules Hub,协助版主管理社区。该工具可由版主自行设定自动执行的规则及触发后的处理动作,先在新创建的社区扩大测试。Reddit 表示,Rules Hub 过去几个月已与 700 多个社区的新版主和老版主测试,并计划于 2026 年晚些时候更广泛上线。

法国 AI 公司 Mistral 发布开源多模态安全分类器 Shieldstral。该模型采用 Apache 2.0 许可,参数规模为 30 亿,可在一张 16GB 的 NVIDIA 显卡上运行。Mistral 表示,它将内容审核转为基于自然语言政策的“是/否”判断,无需为修改规则重新训练模型,并称其在多项安全与多模态基准上可匹敌甚至超过体积大 7 倍的同类开源模型。

欧洲非营利研究组织 AI Forensics 测试发现,Hugging Face 热门影像编辑模型中,9 个里有 7 个会直接响应脱衣裸照指令。研究团队另设蜜罐 Spaces,在 7 天内记录到 1,081 笔请求,其中 73% 与性相关,约 6.7% 涉及儿童目标。报告还称,平台被审计的 Spaces 中仅 3% 设有输出审查,97% 完全没有这道防线。

西雅图警察局2009年建立Seattle Shield私密情报网络,成员包含Amazon、Meta、FBI等数百家实体。2020年泄露名单显示,该网络已从反恐转向监控抗议活动,2025年更将抗议言论定义为恐怖主义迹象。AI技术使监控成本趋零,隐私问题引发关注。
