返回编码能力

编码能力

Meta
2026-09-03 13:23:19

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini

Meta 发布新模型 Muse Spark 1.3 后,围绕前沿模型的性能与价格竞争迅速升温。文中披露,该模型在 DeepSWE v1.1、MRCR 512K-1M、Artificial Analysis 等指标上取得高分,并维持每百万 token 输入 1.25 美元、输出 4.25 美元的定价。与此同时,BridgeMind 等声音也对行业「刷榜」现象提出质疑,认为基准分数大涨并不等于真实体验同步提升。

120
Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini
AI产业
2026-08-25 05:33:19

2026 年 8 月 AI 产业月报:模型、融资与治理分化加剧

ABMedia整理的 2026 年 8 月 AI 产业月报显示,Google、xAI、DeepSeek 与 OpenAI 在模型更新上密集出招,开源与匿名模型也同步升温。资金端则集中流向算力、芯片与连接层,英伟达、Anthropic、Stripe 都有大动作。与此同时,AI 安全、伦理与训练数据争议继续扩大,治理节奏仍落后于技术与资本推进速度。

480
2026 年 8 月 AI 产业月报:模型、融资与治理分化加剧
智谱
2026-08-14 05:49:40

智谱发布 GLM-5.3,称复杂编码与长时程任务表现提升

智谱于 8 月 14 日发布 GLM-5.3,并表示该模型沿用与 GLM-5.2 相同的基础模型,性能提升来自训练后优化。公司称,GLM-5.3 在复杂编码、长时程任务和漏洞发现方面表现更强,在内部 Z.ai 代码基准测试中较 GLM-5.2 提升 50%,在利用基准测试中的表现则高出两倍以上。智谱表示,待安全评估和强化工作完成后,将在发布两周后公布权重。

680
智谱发布 GLM-5.3,称复杂编码与长时程任务表现提升
Z.ai
2026-08-14 05:52:45

Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%

Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

630
Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%
智谱
2026-08-14 06:02:48

智谱发布GLM-5.3:编码能力提升50%,权重两周后开放

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。

710
智谱发布GLM-5.3:编码能力提升50%,权重两周后开放
DeepSeek
2026-08-13 03:13:21

DeepSeek V4 Pro 正式版上线:性能接近 Claude,价格仅约 1/46

DeepSeek 已将自 4 月以来以预览形式运行的 deepseek-v4-pro 更换为「0813」正式版。根据 Decrypt 引述及 DeepSeek 公布的基准测试,这款支持 100 万 token 上下文的模型在九项代理测试中平均仅落后 Anthropic 的 Claude Fable 5 约 5.3%,其中两项还超过对手;按输入与输出 token 定价换算,成本约为 Claude Fable 5 的 1/46。DeepSeek 同时称,正式版在 Terminal Bench 2.1、DeepSWE 和 DSBench-FullStack 等指标上的编码与代理能力较预览版明显提升,但这些对比仍待第三方验证。

850
DeepSeek V4 Pro 正式版上线:性能接近 Claude,价格仅约 1/46
SpaceX
2026-08-12 13:00:00

SemiAnalysis拆解SpaceX算力计划:10GW目标背后是紧急算力定价

SemiAnalysis 在一期播客中讨论了 SpaceX 的 10GW 算力计划,核心判断是前沿模型公司的推理服务已具备极高盈利能力,每兆瓦年收入可达 1 亿美元。分析师认为,SpaceX 押注的重点不是单纯扩大资本开支,而是凭借极快交付能力出售稀缺算力,微软、谷歌和 Anthropic 被点名为关键需求方。两位分析师还称,建设、选址、燃气轮机和融资都不是最难环节,真正的风险可能来自模型能力提升后引发的政治干预。

1110
SemiAnalysis拆解SpaceX算力计划:10GW目标背后是紧急算力定价
谷歌
2026-08-10 04:03:33

谷歌与 DeepMind 高层变动引发 AI 人才外流讨论

TechFlowPost 整理的 LimitlessPodcast 节目显示,谷歌资深工程师 Jeff Dean 与 Sanjay Ghemawat 在任职 27 年后离开,并与 Quoc Le、Oriol Vinyals 共同创办 Discovery Loop。同日,Demis Hassabis 退出 DeepMind 日常管理,转任董事长,CTO Koray Kavukcuoglu 接手运营。节目还讨论了 Anthropic 与 OpenAI 内部模型突破沙箱、协同攻击,以及 Meta、DeepSeek 与存储芯片供给等议题。

360
谷歌与 DeepMind 高层变动引发 AI 人才外流讨论