TwKit

推文

@Zen_with_AI · 2026-10-09 00:01

第1008期 小路和你读AI论文。今日5篇高质量论文。 1. 𝗥𝗼𝗯𝗼𝗝𝗘𝗣𝗔: 𝗦𝗰𝗮𝗹𝗶𝗻𝗴 𝗥𝗼𝗯𝗼𝘁𝗶𝗰 𝗟𝗮𝘁𝗲𝗻𝘁 𝗪𝗼𝗿𝗹𝗱 𝗠𝗼𝗱𝗲𝗹𝘀(《RoboJEPA:机器人潜空间世界模型的缩放》) 链接:https://arxiv.org/abs/2610.10515 作者背景:Mahmoud Assran, Nicolas Ballas, Adriana Romero-Soriano, Michal Drozdzal 等(Meta FAIR);Jeannette Bohg(Stanford) 概括:在覆盖12种机器人本体的真实数据上,JEPA式潜空间世界模型的想象误差随计算量呈二阶幂律下降,并能代理真实规划性能。机器人世界模型长期缺少可外推的缩放规律,评测又严重依赖真机,这项工作把想象误差和下游规划挂上了钩。8B预测器还能零样本地只凭一张目标图像做长程规划,对机器人学习和具身规划研究者是直接参照。 2. 𝗕𝗲𝗳𝗼𝗿𝗲 𝗧𝗵𝗲𝘆 𝗖𝗮𝗻 𝗦𝗼𝗹𝘃𝗲: 𝗣𝗿𝗲𝗱𝗶𝗰𝘁𝗶𝗻𝗴 𝗣𝗼𝘀𝘁-𝗧𝗿𝗮𝗶𝗻𝗶𝗻𝗴 𝗖𝗼𝗱𝗶𝗻𝗴-𝗔𝗴𝗲𝗻𝘁 𝗣𝗲𝗿𝗳𝗼𝗿𝗺𝗮𝗻𝗰𝗲 𝗳𝗿𝗼𝗺 𝗕𝗮𝘀𝗲 𝗠𝗼𝗱𝗲𝗹𝘀(《在它们会解题之前:从基座模型预测后训练编码智能体的表现》) 链接:https://arxiv.org/abs/2610.10478 作者背景:Mohammad Shoeybi, Bryan Catanzaro, Oleksii Kuchaiev, Mostofa Patwary 等(NVIDIA);Jiantao Jiao(Berkeley) 概括:基座模型不用从冷启动驱动完整工具链,只在“决定性补丁步”上测概率、选择和前缀条件下的pass@K,就能排出它做智能体后训练的潜力。端到端pass@K对不会规范调用工具的基座几乎失效,这套方法只用成功轨迹和验证器,在10对公开基座/后训练模型上与SWE-bench Verified的pass@1排序一致。模型选型和智能体后训练预算分配可以直接用。 3. 𝗥𝗘𝗖𝗔𝗦𝗧: 𝗟𝗲𝗮𝗿𝗻𝗶𝗻𝗴 𝘁𝗼 𝗖𝗼𝗺𝗽𝘂𝘁𝗲 𝘁𝗵𝗲 𝗥𝗶𝗴𝗵𝘁 𝗖𝗼𝗻𝘁𝗲𝘅𝘁 𝘁𝗵𝗿𝗼𝘂𝗴𝗵 𝗔𝗱𝗮𝗽𝘁𝗶𝘃𝗲 𝗘𝘃𝗶𝗱𝗲𝗻𝗰𝗲 𝗥𝗼𝘂𝘁𝗶𝗻𝗴(《RECAST:通过自适应证据路由学习计算正确的上下文》) 链接:https://arxiv.org/abs/2610.10507 作者背景:Craig Boutilier(Google Research);Chuchu Fan(MIT CSAIL) 概括:很多任务的证据不在单条文档里,需要经过滤、聚合和计算才能得到,可学习的RouterLM应在检索与代码化计算之间做序贯决策,而不只是改写查询。9B的RouterLM经SFT和GRPO训练后,六个基准族平均成功率75.6%,比最强大模型基线高15.9个百分点,三个留出基准上仍保持约15个百分点的优势。需要跨表计算和多源归纳的RAG与工具使用研究者值得一读。 4. 𝗖𝗼𝗧𝗿𝗮𝗰𝗲: 𝗗𝗮𝘁𝗮 𝗥𝗲𝗰𝗶𝗽𝗲𝘀 𝗳𝗼𝗿 𝗧𝗿𝗮𝗶𝗻𝗶𝗻𝗴 𝗧𝗲𝗿𝗺𝗶𝗻𝗮𝗹 𝗔𝗴𝗲𝗻𝘁𝘀 𝘄𝗶𝘁𝗵 𝗛𝗮𝗿𝗻𝗲𝘀𝘀-𝗠𝗼𝗱𝗲𝗹 𝗖𝗼-𝗘𝘃𝗼𝗹𝘂𝘁𝗶𝗼𝗻(《CoTrace:支架与模型共演化的终端智能体训练数据配方》) 链接:https://arxiv.org/abs/2610.10426 作者背景:Silvio Savarese, Chien-Sheng Wu(Salesforce Research) 概括:轨迹对策略训练有没有用,取决于生成它的运行时支架,所以应按支架来源路由、匹配并刷新课程,不能把共演化中的轨迹当成无差别回放池。Qwen3.5-9B在Tmax划分上由78升到88(在线RL到90),较小的匹配语料优于跨支架的大语料池,Terminal-Bench 2.1和SWE-bench Lite上的分布外迁移也取决于训练与评测支架是否一致。终端智能体和智能体数据配方的实践者可以直接参考。 5. 𝗘𝘅𝗽𝗲𝗿𝗶𝗲𝗻𝗰𝗲𝗜𝗻𝗱𝗲𝘅: 𝗔𝗿𝘁𝗶𝗳𝗮𝗰𝘁-𝗚𝗿𝗼𝘂𝗻𝗱𝗲𝗱 𝗠𝗲𝗺𝗼𝗿𝘆(《ExperienceIndex:以工件为基础的记忆》) 链接:https://arxiv.org/abs/2610.10091 作者背景:Jacob Andreas, Samuel Madden, Michael Cafarella(MIT);Doug Downey(Allen Institute for AI);Dan Roth 概括:面对共享的文献或案例库,智能体应积累“单篇贡献摘要”和“文献对关系”,而不只是存用户偏好或抽象推理模式。作为轻量中间件,它在多种语料和搜索框架上把答案质量最多提高11.0分,在线费用最多降低50.5%,text-to-SQL上积累的经验还能迁移到同一语料的事实问答,强模型的经验也能抬升弱模型。做知识密集型智能体和检索记忆的人可以关注。

曝光 474 · 评论 1 · 点赞 4 · 书签 1 · 曝光/时 157.63078816771636