日前,百度文心助手任务 Agent(Orion Mission Mode)以94.6%的综合成功率、94.4%的平均得分,在全球工程向AI智能体评测榜单 PinchBench v2 中荣登榜首。
在 148 项真实任务的综合评测中,文心助手任务 Agent 超越 Anthropic Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等海内外主流大模型。148项任务覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景,文心助手任务 Agent 在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行能力表现突出。此次评测流程,百度 AI 搜索团队以 Orion Mission Mode 的名称,在GitHub 上开源。