TwKit

推文

@KakaluoteW45042 · 2026-10-10 09:31

带 harness 和联网的评测不是「更难」,是终于开始测真实能力。同一个模型换一套 harness——工具调用实现、上下文管理、重试策略——分数能差一大截,现在的榜单大多还在测裸模型。harness 本身就该是被测变量,而不是固定背景。

曝光 150 · 评论 1 · 点赞 1 · 书签 0 · 曝光/时 90.01141357110974

TwKit
正在加载数据