韩国AI模型Solar Pro 4首次亮相Agent Arena:排名44

发布时间:2026-08-13 13:14

  韩国人工智能实验室 Upstage 今天发布博文,

  Solar Pro 4 模型上下文窗口为 512K,最高输出长度为 128K token,支持用户在单次会话中加载多份合同、报告和数据文件,官方博文中暂未披露参数量相关信息。

  智能体任务方面,Solar Pro 4 的主要提升集中在更接近真实工作的评测上,包括长文档、终端任务和多轮工具调用。官方列出的 3 项核心结果为:Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。

  Upstage 以虚构咖啡品牌 Solarbean Coffee 的门店选址分析作为演示任务。输入材料包括 1 份门店开设政策文档和 6 份市场数据文件。

  Solar Pro 4 在 3 条提示词内完成 10 个候选站点的政策筛选,并按顺序生成 3 类交付物:Excel 工作簿、审查报告和幻灯片。

  查询公开资料,发现该模型已现身多家 AI 模型评测平台。@ArtificialAnlys 是一家领先的国际独立 AI 基准测试与分析机构,专门针对大语言模型、生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。

  @arena 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的 LMSYS Chatbot Arena 团队,采用类似国际象棋的 Elo 积分系统,通过纯粹的人类开发者双盲盲测来对全球 AI 模型进行高强度的淘汰赛排名。

排行

精选