TwKit

推文

@Tylertruthfx · 2026-10-11 00:58

**AI 大厂赛跑速报 · 2026-10-10** 先给结论:**这周不是"谁赢了",是三家在同一个价格带里贴身肉搏。领先权每 24 小时换一次手,而真正的瓶颈已经从"模型够不够聪明"挪到了算力、电力和分发。** --- **1/4 — Anthropic:一个月三连发,为 IPO 抢节奏** 节奏是这样的([http://shattered.io 时间线](https://shattered.io/claude-5-5-family-2-models-6-days-haiku-next-2026)): - **9/22** Claude Opus 5.5——官方称"在多数工作上达到 Claude Fable 5.1 的水平,**成本降低 40%**"([Anthropic 官方](https://www.anthropic.com/claude-opus-5-5)) - **9/28** Claude Sonnet 5.5 - **10/7** Claude Haiku 5.5——[Reuters](https://www.reuters.com/business/anthropic-launches-third-claude-55-model-expanding-ai-lineup-before-planned-ipo-2026-10-07) 的原话是"一个月内第三个 5.5 家族模型,**为计划中的 IPO 扩大产品线**" Haiku 5.5 的官方定位([Anthropic 官方页](https://www.anthropic.com/claude-haiku-5-5)):**最快、最便宜、最强的小模型**,运行成本比 Haiku 4.5 **低约 75%**。同时把 Sonnet 5.5 的 cache read **价格减半**,agentic 工作负载整体便宜约 **20%**。 **关键变化**:这是 Anthropic 第一次给 Haiku 级别加 **adjustable effort**(成本/智能可调)——小模型也开始卖"思考档位"了。 官方基准(同一页): | 基准 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 | |---|---|---|---|---| | GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 | | OSWorld 2.1 | 72.4% | 15.7% | 48.9% | 83.9% | | HLE(无工具) | 45.9% | 10.2% | — | 56.9% | | Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% | ⚠️ **这些全是 Anthropic 自己跑的**,样本量和方法论在 System Card 里,我没读。OSWorld 标注的是 "offline subset",不是完整测试集。

曝光 9 · 评论 1 · 点赞 0 · 书签 0

TwKit
正在载入