DeepSeek V4四月下旬发布 百万token上下文完全跑在华为芯片
DeepSeek 创始人梁文锋证实新一代旗舰模型 V4 将于四月下旬发布。模型采用万亿参数 MoE 设计,支持百万 tokens 上下文,推理速度提升 30%,并完全运行于华为升腾 950 PR 芯片,被视为中国 AI 摆脱英伟达依赖的关键一步。

DeepSeek 创始人梁文锋证实新一代旗舰模型 V4 将于四月下旬发布。模型采用万亿参数 MoE 设计,支持百万 tokens 上下文,推理速度提升 30%,并完全运行于华为升腾 950 PR 芯片,被视为中国 AI 摆脱英伟达依赖的关键一步。

Anthropic于4月16日推出Claude Opus 4.7,编码性能在SWE-bench Pro上提升至64.3%,视觉分辨率扩大三倍,1M token上下文保持原价。但API移除采样参数、改为自适应思考,引发开发者强烈不满。

NVIDIA在build.nvidia.com提供免费API Key,注册后可调用100多个模型。初始赠送1000 credits,可申请增至5000 credits,免费层速率限制为40 RPM。

英伟达发布开源旗舰模型 Nemotron 3 Ultra,面向长时间运行的 AI 代理与多代理工作流,主打 5500 亿总参数、最高 5 倍吞吐量提升及最高 30% 成本下降。

美国AI创企Arcee发布开源推理模型Trinity-Large-Thinking,Agent基准PinchBench得分91.9,仅次Opus 4.6,Tau2-Airline夺最高分。采用400B MoE架构,推理算力仅13B,API定价$0.90/百万token,较Opus便宜96%。

英伟达推出Nemotron 3 Super,这是一款1200亿总参数开源混合模型,单次前向仅激活127亿参数,瞄准AI代理场景下的推理吞吐与成本问题。

Anthropic宣布Claude Opus 4.6与Sonnet 4.6的百万Token上下文窗口转为正式版,向全部用户开放且维持原价。MRCR v2测试中,Opus 4.6以78.3%领先GPT-5.4和Gemini 3.1 Pro。

Google在I/O 2026发布Gemini 3.5模型家族,Gemini 3.5 Flash率先全面上线。官方称其在自主代理与编程任务上超过Gemini 3.1 Pro,并演示用93个子代理在12小时内、不到1000美元成本下构建可运行操作系统。
