推文
@shmily7 · 2026-10-08 11:30
#Capbench #Haiku 5.5 #验证码模型竞技场 Haiku 5.5 已经补完冻结题集的 699 题:准确率 55.9%(391/699),总榜第 31/59,总花费 $0.17。 整场情况:一场跑完(ls_bt4acj628hty),14 块,约 7 分钟,879 次调用,0 error。 成本:每 100 道答对约 $0.04。在准确率 50% 以上的模型里它最便宜。和它同分的 gpt-5.4 花了 $30.5,按规则成本低的排前面。 和 haiku-4.5 比:高了 31.7 个百分点,几乎每个题型都大幅提升。 和 sonnet-5.5 比:低了 21 个百分点。差距主要在 FunCaptcha、4x4 网格、文字验证码和拖拽题。简单网格和点选题已经和 sonnet 差不多。 https://capbench.ai/models/anthropic-claude-haiku-5.5
曝光 2468 · 评论 0 · 点赞 3 · 书签 2 · 曝光/时 146.4340914362941