Qwen发布多模态模型Qwen3.8-Omni-Flash
Qwen推出首款面向AI智能体设计的多模态模型Qwen3.8-Omni-Flash,可同时处理音频和视频,并能独立调用工具完成视频博客编辑、视频片段翻译和电影内容总结。Techub援引The Decoder称,该模型在音视频基准测试中的表现接近Google Gemini 3.8 Flash,但API调用成本更低。

Qwen推出首款面向AI智能体设计的多模态模型Qwen3.8-Omni-Flash,可同时处理音频和视频,并能独立调用工具完成视频博客编辑、视频片段翻译和电影内容总结。Techub援引The Decoder称,该模型在音视频基准测试中的表现接近Google Gemini 3.8 Flash,但API调用成本更低。

模型聚合平台 OpenRouter 已上线新模型「Z.ai: GLM 5.3 FlashX」。该模型为 Z.ai 旗下 GLM-5.3-Flash 的高速变体,属于原生多模态模型,推理速度最高可达每秒 200 个 token。OpenRouter 还表示,平台上架时间有时早于厂商官方公布,未官宣前会使用「疑似」或「即将」等措辞。


一篇获 EMNLP 2026 接收的论文识别出大模型内部的多模态检索头,并验证其对访问文字、图片和版面证据具有因果作用。研究覆盖 6 个长上下文视觉语言模型,相关信号还被用于多模态文档检索。

DeepSeek 已开源 DeepSeek-V4-Flash-Vision-Exp。该模型是 DeepSeek-V4 系列首个实验性多模态模型,基于 V4-Flash 架构加入视觉模块,并通过继续训练获得图片理解能力。官方信息显示,模型可识别截图、读取图表,并结合工具完成 Agent 任务;在纯文本 Agent 任务上,表现仍与 V4-Flash 相当。该模型参数规模为 305B,采用 MIT 许可证。

腾讯发布的研究论文显示,多模态AI模型在非思考模式下,响应失败率最高可增加48%。研究建议改进评估指标,应更重视回答的连贯性与质量,而非仅追求正确性,以提升用户体验。


Z.ai 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型,也是实验室最具性价比的编程模型。该模型采用混合专家架构,总参数量 3200 亿,每个令牌激活 180 亿参数,支持 1,048,576 个令牌上下文、图像和视频输入,并以 MIT 许可证开源,权重已上传至 Hugging Face。
