推文
@alacheng · 2026-10-10 10:34
在模型上下游,之前看到了有RL环境公司,数据公司。最近又有两家(UniPat和Arena)从另一个角度切入,做的AI评测基础设施的公司,融到了不少资金。 他们主要解决的问题是:传统静态benchmark容易被刷分、无法反映真实表现。 其中UniPat AI创始人李宽之前还只是在阿里通义实验室做实习生。最近传出阿里领投约3亿美元后期轮,估值约25亿美元,腾讯、红杉中国(HSG)等参与/跟投。 Arena: AI模型评测平台Arena完成2亿美元B轮融资,估值31亿美元,ARR达1亿美元 2023年由UC Berkeley(加州大学伯克利分校)Sky Computing Lab的研究项目Chatbot Arena起步,通过用户盲测投票(A/B对比)来对大模型排名,形成著名的公开Leaderboard。 Arena主要产品: -免费公众平台:用户提交prompt或任务,对比不同模型输出并投票,生成Elo排名。覆盖文本、视觉、代码、Agent等模态。 -商业产品(AI Evaluations):面向模型实验室和企业,提供基于真实用户反馈的深度性能分析(按用量收费,非纯订阅)。 -最新方向:扩展到AI Agent行为与安全性评估,推出Alignment Index(对齐指数),监测未授权行为、虚假完成任务等。 https://arena.ai/ UniPat AI: 创始人李宽等曾在阿里巴巴通义AI实验室等从事后训练分析、数据合成、强化学习工作。团队来自头部大模型公司研究员。 主要产品: -开源评测基准:如BabyVision(多模态视觉理解,曾显示多数模型视觉能力低于3岁儿童水平)、SaaS-Bench(真实SaaS工作流中的Agent评测)、Terminal-X/编程Agent相关、ExpertEval(医疗/金融/法律专业判断)等。 -数据与训练服务:专家数据、合成数据,服务中国主流模型厂商(阿里、字节、Moonshot、DeepSeek等)。 https://unipat.ai/
曝光 689 · 评论 7 · 点赞 12 · 书签 7 · 曝光/时 149.4274585045042