TwKit

推文

@kafkaup · 2026-10-09 01:43

📄 TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts 概述:TasteVal是一个新基准,用计算效率乘数衡量AI模型相对人类专家的实验研究品味,结果显示表现最佳的Opus 5.5模型已超越专家基线,且该乘数自2025年底起的翻倍周期大幅缩短。 核心贡献:该研究最主要的贡献是提出“计算效率乘数”这一可量化指标,用以衡量模型相对人类专家在实验研究品味上的效率差异,并据此追踪前沿模型的能力演变趋势。 实验结果:作者报告,表现最佳的Opus 5.5模型以仅为专家基线约1/30的单次运行成本,取得2.3倍(95%置信区间1.15至4.37)的计算效率乘数;该乘数自2025年12月起每约3.0个月翻倍,远快于2023年至2025年12月间每14个月翻倍一次的速度,而按最终归一化表现衡量则无趋势断裂,仍维持每14.6个月翻倍。

曝光 77 · 评论 1 · 点赞 0 · 书签 0