返回创意写作

创意写作

Google
2026-08-16 16:02:49

Gemini 3.7 Flash 实测:代码大幅进步,推理与写作仍有短板

Google 于 8 月 13 日发布 Gemini 3.7 Flash,并在首日向 160 多个国家开放。Decrypt 实测显示,这款模型在零样本代码生成上较 3.6 Flash 明显提升,2 分 13 秒就生成可运行浏览器游戏;但在创意写作、隐喻推理、逻辑题和高阶数学任务中,表现并不稳定。Google 给出的基准测试称其在 18 个类别中有 11 项领先 Claude Sonnet 5 和 GPT-5.6 Terra,不过文中也指出这些数据来自 Google 自家方法论。

750
Gemini 3.7 Flash 实测:代码大幅进步,推理与写作仍有短板
Mira Murati
2026-07-26 14:01:03

Mira Murati 首个开源模型 Inkling 亮相,工具调用成绩突出但实测表现分化

Mira Murati 离开 OpenAI 两年后,旗下 Thinking Machines Lab 上周公开首个模型 Inkling。该模型采用 MoE 架构,总参数 9750 亿、推理激活参数 410 亿,支持文本、图像和音频输入,上下文窗口达 100 万 token,并以 Apache 2.0 许可证在 Hugging Face 提供完整权重。Decrypt 评测认为,它是西方实验室从零训练后发布的最强开源模型之一,但在编码、逻辑、创意写作和内容审查等多项实测里表现并不均衡。

1130
Mira Murati 首个开源模型 Inkling 亮相,工具调用成绩突出但实测表现分化
OpenAI
2026-07-18 15:21:03

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负

OpenAI 这次没有推出带“思考档位”的单一模型,而是将 GPT-5.6 拆分为 Sol、Terra 和 Luna 三个独立模型。Decrypt 的对比把焦点放在 Sol 与 Anthropic 当前最强公开模型 Claude Fable 5 身上:Sol 在多项编码基准、速度和成本上占优,Fable 5 在创意写作与单次生成浏览器游戏的主观测试中更出色。文章还指出,Fable 5 在 6 月被美国政府禁用、7 月 1 日恢复后,多次临时延长订阅访问期限,最新截止日期为 7 月 19 日。

1280
GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负
PrismML
2026-07-15 19:55:41

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行

PrismML推出 Bonsai 27B,称其是首个突破消费级智能手机内存门槛的 27B 级 AI 模型。该模型压缩后最低仅 3.9 GB,可在 iPhone 17 Pro Max 上以 11 tokens/s 运行,三值版本为 5.9 GB,在 M5 Pro 笔记本上约 26 tokens/s。PrismML表示,Bonsai 27B 采用基于 Caltech 知识产权的压缩方法,并以 Apache 2.0 免费提供下载。公司 CEO Babak Hassibi 还向 CNBC 确认,PrismML 正与苹果进行早期接触,苹果在评估这项压缩技术是否适合端侧部署。

1110
PrismML发布 Bonsai 27B,可在 iPhone 上本地运行
ICML 2026
2026-07-15 07:53:09

ICML 2026接收提示词工程论文,Reddit围绕研究价值激辩

一篇提出 Verbalized Sampling(VS)方法的论文被 ICML 2026 接收后,在 Reddit 引发热议。论文称,仅通过调整提示词并让模型输出概率分布,就能缓解大语言模型的模式坍缩,在创意写作任务中将多样性提升至普通提示的 1.6 至 2.1 倍。争议集中在“Prompt 技巧”是否足以构成顶会级机器学习研究,而支持者则认为,论文对偏好数据中的“典型性偏差”提出了更关键的解释。

1100
ICML 2026接收提示词工程论文,Reddit围绕研究价值激辩