TwKit

推文

@renmu2017 · 2026-10-11 10:29

Agent组队干活,最强模型只完成50%任务!基准评测协作能力 Agent已经能独立编写代码和检索文献 但单个Agent能做事 不等于一组Agent就能配合完成任务 这项协作能力基准评测里 最强模型只完成了50%的任务 单体能力和组队协作 仍是两道不同的关卡 https://aiera.com.cn/2026/10/11/other/admin/118040/agent%e7%bb%84%e9%98%9f%e5%b9%b2%e6%b4%bb%ef%bc%8c%e6%9c%80%e5%bc%ba%e6%a8%a1%e5%9e%8b%e5%8f%aa%e5%ae%8c%e6%88%9050%e4%bb%bb%e5%8a%a1%ef%bc%81%e5%9f%ba%e5%87%86%e8%af%84%e6%b5%8b%e5%8d%8f%e4%bd%9c/

曝光 23 · 评论 2 · 点赞 1 · 书签 0 · 曝光/时 14.934911597558909

TwKit
正在载入