TwKit

Claude与OpenAI模型竞争:能力差距如何比较

AI科技 · 7 篇公开推文 · 5 位作者 · 曝光 164213 · 评论 195 · 点赞 945 · 书签 240

围绕Claude、GPT和其他模型的能力、价格及使用体验,推文评价模型差距与厂商竞争,也出现对闭源模型能力的具体比较。

创作角度

  • 邵艾伦播客中关于AI机会的论述,哪些具体判断能用来检验当前模型竞争?
  • OpenAI与Anthropic的模型能力比较,如何通过同一任务、相同预算和盲测来评估?
  • 关于“被干沉默”或“差距巨大”的说法,哪些是体验分享、哪些需要基准数据支持?

相关公开推文

@ScarletKc

人们宁愿想尽一切办法,冒着封号的风险,折腾各种复杂的环境,也要坚持用 Claude,真的不是没有原因的。 模型之间的差距已经大到有些离谱了。 有些事情交给 Claude,你只需要说清楚自己想要什么,它就能理解你的意图,甚至把你没想到的地方一起做好。 换成 GPT,可能折腾几个小时、写几十轮 Prompt、反复纠正,最后还是做不出来。 最恐怖的是,用惯了 Claude 之后再换回 GPT,你会发现自己突然需要亲自思考和处理大量原本根本不用操心的细节。 这已经不是什么回答质量高一点、代码能力强一点的区别了。 这是两个完全不同的生产力时代。

曝光 81251 · 评论 123 · 点赞 613 · 书签 145

查看原帖
@NFT_Chen

🤨闭源抄袭开源!近期OpenAI、Anthropic的新模型Opus 5.5、GPT-6.1 Sol 缓存价暴跌源自偷吃了 DeepSeek V4.1 Flash开源的技术红利!Dario、Sam Altman偷学了梁文峰的武功! OpenAI、Anthropic 缓存读取价一天掉 60%–80%。海外技术人员怀疑:不是自己顿悟,是吃了 DeepSeek 开源的 KV Cache 红利。 具体要点; 1️⃣长上下文、Coding、Agent 烧的不是算力,是显存。KV Cache 把已处理信息压在 GPU 里,上下文一长,一张卡能扛的用户数直接塌掉。 2️⃣DeepSeek 这条压缩路线是公开的。MLA 先把缓存压约 15 倍,再上 Compressed Sparse Attention、Heavily Compressed Attention。V4.1-Flash 叠 CSA2、跨层缓存复用、因果 encoder-decoder、FP4 caching,全局 KV cache 压到约 890 bytes/token。 3️⃣数字很刺眼。原文场景里,V1 长上下文约 389GB/百万 token,V4.1-Flash 只要 890MB,大约缩小 437 倍。 4️⃣降价被当成旁证。Claude Opus 5.5 缓存读取价比上一代降约 60%,GPT-6.1 Sol 比 7 月底的 GPT-5.6 Sol 降约 80%。问题只有一个:底层是不是也发生了同类效率突破? 5️⃣发布姿势也被拿来解读。Opus 5.5、GPT-6.1 Sol 都偏安静上线。作者说两家“有点尴尬”,所以没大张旗鼓预告。体验不差,和文中提到的旗舰 Claude Fable 5.1、GPT-6 Astra 也没拉开明显差距。 6️⃣原文比标题克制。写的是“未经致谢的采用”,不是坐实抄袭。KV Cache 优化本就是全行业方向,独立研发完全可能。真正尴尬的是叙事反转:一边控诉中方蒸馏,一边自己的缓存成本曲线,和 DeepSeek 公开路线撞在一起。 算力受限逼出来的开源效率,正在改写闭源的成本故事。 原文:https://insufferable.dev/posts/the-ai-race-just-got-awkward/ #deepseek #KVCache #opus55 #开源大模型 #推理成本 #anthropic #OpenAI #梁文峰 #梁圣

曝光 32092 · 评论 32 · 点赞 122 · 书签 41

查看原帖
@NFT_Chen

Google 发布会总结: Antigravity CLI 彻底沦为 Claude 的代理框架 Sonnet 5.5 = 最优性能的 Gemini 模型 Google 不认马斯克、不认Sam Altman、只认Dario

曝光 18754 · 评论 8 · 点赞 27 · 书签 14

查看原帖
@yifanxu_ephai

希望说这话的朋友来自O或者A 其他厂商就以下几种情况: 1. 模型迭代便秘难产,近一年无法退出个小版本。 2. Somehow几家靠自己RL训练出来了,但是模型能力略逊于ds v4.1 Flash、K3、GLM 5.3。 3. 基于国产开源模型+自家后训练,整出个还可以的模型。

曝光 18591 · 评论 8 · 点赞 80 · 书签 21

查看原帖
@fkysly

准备从 deepseek v4.1 flash 和 DSH 改回 Claude Code 和 Opus 5.5 了。没办法,后者现在还是太优秀了。 而且看分析,好像 Claude 订阅的 tokens 性价比比 DeepSeek v4.1 flash 还要高

曝光 12827 · 评论 14 · 点赞 39 · 书签 10

查看原帖
@ScarletKc

好家伙,原来 Claude Code 不变 Sonnet 5.5 的 cache read 价格砍了一半,现在每百万 token $0.10,官方说大部分 agentic 任务能便宜 20% 左右。结果最后一行括号里补了一句,只限 API,Claude Code 的用量限制没变

曝光 10811 · 评论 8 · 点赞 44 · 书签 6

查看原帖
@lilililiMozi

P 姐和 tibo 吵架,这波我站 P 姐,因为她让大伙 20 刀就能吃上 Opus 5.5。 而 tibo 这个无能的小丑只会把削减额度的账号拍我脸上然后顺便用垃圾模型在仓库里面投毒。 本质还是强模型对弱模型的胜利,基模厂模型做不好干啥都是错的。

曝光 8419 · 评论 2 · 点赞 20 · 书签 3

查看原帖
TwKit
正在加载数据