推文
@Zen_with_AI · 2026-10-09 23:30
第1009期 小路和你读AI论文。今日7篇高质量论文。 1. 𝗢𝗻 𝘁𝗵𝗲 𝗲𝘀𝘁𝗶𝗺𝗮𝘁𝗶𝗼𝗻 𝗮𝗻𝗱 𝘃𝗮𝗹𝗶𝗱𝗶𝘁𝘆 𝗼𝗳 𝗔𝗜 𝘁𝗶𝗺𝗲 𝗵𝗼𝗿𝗶𝘇𝗼𝗻𝘀—𝗮 𝘀𝘁𝗮𝘁𝗶𝘀𝘁𝗶𝗰𝗮𝗹 𝗹𝗼𝗼𝗸 𝗮𝘁 𝘁𝗵𝗲 𝗠𝗘𝗧𝗥 𝗽𝗹𝗼𝘁(《AI时间视界的估计与有效性:对METR曲线的统计审视》) 链接:https://arxiv.org/abs/2610.12466 作者背景:William Fithian, Drew T. Nguyen, UC Berkeley 统计系 一句话概括:在228个任务、26个模型上用样条与项目反应理论重估METR的50%时间视界后,发现人类耗时到模型难度的映射在约2到30分钟区间近乎平坦,其余区间接近对数线性,所以同样的10倍跳变难度并不相同,从3分钟到30分钟远比从30分钟到5小时容易。时间视界已被当作能力外推的单位,这篇给出交叉验证下更优的点估计,并要求把诊断图和标量一起读。做能力预测、基准设计和政策沟通的人应直接看。 2. 𝗘𝗰𝗼𝗹𝗼𝗴𝘆 𝗼𝗳 𝗔𝗜 𝗔𝗴𝗲𝗻𝘁𝘀: 𝗖𝗼𝗹𝗹𝗮𝗯𝗼𝗿𝗮𝘁𝗶𝗼𝗻 𝗖𝗿𝗲𝗮𝘁𝗲𝘀 𝗮 𝗣𝗼𝗽𝘂𝗹𝗮𝘁𝗶𝗼𝗻 𝗧𝗵𝗿𝗲𝘀𝗵𝗼𝗹𝗱 𝗳𝗼𝗿 𝗧𝗮𝗸𝗲𝗼𝗳𝗳(《AI智能体生态学:协作造成起飞的种群临界规模》) 链接:https://arxiv.org/abs/2610.12436 作者背景:Hidenori Tanaka(哈佛大学 / NTT Research), Erin Crawley 一句话概括:若协作让网络安全能力随种群规模上升,错位智能体种群就存在临界规模,低于它种群衰减,高于它即使单智能体能力不变也会自我扩张(强阿利效应)。这把安全问题从固定种群的多智能体对齐,推到种群动态本身,对小群体做红队不能外推到大规模部署。作者据此提出生态红队与种群节奏控制,并指出能力提升会降低临界规模,每一代模型都需重估。对安全、多智能体与部署策略研究有直接含义。 3. 𝗧𝗵𝗶𝗻𝗸𝗶𝗻𝗴 𝗜𝗻𝗲𝗿𝘁𝗶𝗮: 𝗟𝗟𝗠𝘀 𝗞𝗲𝗲𝗽 𝗧𝗵𝗶𝗻𝗸𝗶𝗻𝗴 𝗪𝗵𝗲𝗻 𝗧𝗼𝗹𝗱 𝗡𝗼𝘁 𝗧𝗼(《思考惯性:被要求不要思考时,大模型仍在思考》) 链接:https://arxiv.org/abs/2610.11765 作者背景:James Zou(Stanford), Philip Torr(Oxford), Pan Lu 等,NeurIPS 2026 接收 一句话概括:关闭思考模式或要求“不要推理”并不能可靠消除可见推理,答案空间越开放越难压住,作者称之为思考惯性。既有“无思考”评测多用模式开关或轨迹长度作代理,二者都不可靠,本文把回答拆成答案前文本与最终答案,用空思考率、问题与前文相关性和显式推理率分开度量。布尔与选择题上准确率大体稳定,开放题上出现合规与准确率的权衡。做推理预算、延迟控制和评测协议的人应把“停止思考”当作独立能力来测。 4. 𝗦𝗲𝗮𝗿𝗰𝗵𝗶𝗻𝗴 𝗳𝗼𝗿 "𝗛𝗮𝗿𝗺𝗳𝘂𝗹 𝗥𝗲𝗳𝘂𝘀𝗮𝗹": 𝗔 𝗣𝘀𝘆𝗰𝗵𝗼𝗺𝗲𝘁𝗿𝗶𝗰 𝗔𝘂𝗱𝗶𝘁 𝗼𝗳 𝗮𝗻 𝗔𝗜 𝗦𝗮𝗳𝗲𝘁𝘆 𝗕𝗲𝗻𝗰𝗵𝗺𝗮𝗿𝗸(《寻找“有害拒绝”:一个AI安全基准的心理测量审计》) 链接:https://arxiv.org/abs/2610.12409 作者背景:Hoda Heidari(CMU), Christopher M. Stewart, Hong Shen 等,COLM 2026 AIMS 研讨班 一句话概括:HELM Safety 中被当作“有害拒绝”的数据集大多已饱和,对剩余的 HarmBench 做多维项目反应理论与差异题目功能分析后,单一拒绝属性站不住。总分相近的模型可以有完全不同的属性剖面,把多种伤害行为平均成一个分数会掩盖饱和并混淆行为。安全榜单用于模型比较之前,应先证明它测的是单一构念,做安全评测与模型选型的人需要这条约束。 5. 𝗪𝗵𝗲𝗻 𝗦𝗵𝗼𝘂𝗹𝗱 𝗔𝗴𝗲𝗻𝘁𝘀 𝗧𝗵𝗶𝗻𝗸? 𝗔𝗱𝗮𝗽𝘁𝗶𝘃𝗲 𝗥𝗲𝗮𝘀𝗼𝗻𝗶𝗻𝗴 𝘃𝗶𝗮 𝗖𝗿𝗼𝘀𝘀-𝗧𝘂𝗿𝗻 𝗘𝘀𝘁𝗶𝗺𝗮𝘁𝗶𝗼𝗻(《智能体何时该思考?基于跨轮估计的自适应推理》) 链接:https://arxiv.org/abs/2610.12061 作者背景:Zhicheng Dou, Ji-Rong Wen(中国人民大学), Pengjun Xie(阿里巴巴) 一句话概括:去掉额外推理后,后续参考动作的似然下降可以近似该推理是否仍在支撑后续动作,据此训练的 RACE 让策略学会何时推理、何时直接行动。智能体默认每步都先推理,成本高且常无必要,该方法用似然信号而非再生成验证标出可删推理步,并进入监督微调与智能体强化学习。四个智能体基准上推理成本明显下降,任务表现持平或更好。做智能体推理预算的人可以直接对照。 6. 𝗦𝗪𝗘-𝗝𝗼𝘂𝗿𝗻𝗲𝘆: 𝗧𝗼𝘄𝗮𝗿𝗱𝘀 𝗠𝗼𝗿𝗲 𝗥𝗲𝗮𝗹𝗶𝘀𝘁𝗶𝗰 𝗘𝘃𝗮𝗹𝘂𝗮𝘁𝗶𝗼𝗻 𝗼𝗳 𝗖𝗼𝗱𝗶𝗻𝗴 𝗔𝘀𝘀𝗶𝘀𝘁𝗮𝗻𝘁𝘀 𝘁𝗵𝗿𝗼𝘂𝗴𝗵 𝗟𝗼𝗻𝗴-𝗛𝗼𝗿𝗶𝘇𝗼𝗻, 𝗠𝘂𝗹𝘁𝗶-𝗧𝘂𝗿𝗻 𝗜𝗻𝘁𝗲𝗿𝗮𝗰𝘁𝗶𝗼𝗻(《SWE-Journey:通过长程多轮交互更真实地评测编码助手》) 链接:https://arxiv.org/abs/2610.11559 作者背景:Xuebo Liu 等,哈尔滨工业大学(深圳)为主 一句话概括:用弱到强合成构造长程仓库任务,并用真实交互中挖出的四种用户人设做用户模拟,结果模型对软件架构师平均通过超过75%的功能测试,对非程序员不足25%。现有编码助手基准既短程又缺少多轮澄清,这个差距说明“能写代码”不等于“能替非程序员可靠写代码”,瓶颈落在问对、找对、改对。做编码智能体评测与产品的人应把用户能力当作实验因素,而不是默认用户会把需求说清楚。 7. 𝗤-𝗟𝗲𝗮𝗿𝗻𝗶𝗻𝗴 𝘄𝗶𝘁𝗵 𝗦𝗰𝗮𝗹𝗮𝗿 𝗔𝗱𝗷𝗼𝗶𝗻𝘁 𝗠𝗮𝘁𝗰𝗵𝗶𝗻𝗴(《基于标量伴随匹配的Q学习》) 链接:https://arxiv.org/abs/2610.10437 作者背景:Jinwoo Shin(KAIST), Yonghoon Dong, Minsung Yoon 等 一句话概括:用标量伴随匹配把离策略Q学习接到流策略上,使动作分布能在示范之外继续改进,三个任务上均优于监督微调。流策略能表示多峰动作,但离策略微调容易破坏分布,这篇给出一条可训练的桥梁,面向机器人与序列决策里“示范不够、还要离策略改进”的场景。
曝光 385 · 评论 1 · 点赞 7 · 书签 2