StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准。与研究者预设的测试任务不同,StartupBench 从真实用户采用的产品工作流中提炼任务,因此更贴近现实使用场景。在统一的智能体框架下,当前最强的模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识不足是主要的失败来源。该基准揭示了现有通用智能体在真实用户任务上的能力边界,也为后续智能体能力评估与改进提供了参考。
StartupBench:面向市场验证端到端工作流的通用智能体基准测试
StartupBench 是一个基于真实市场验证的 AI 初创公司产品工作流构建的端到端智能体基准。测试显示,在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识不足是主要失败原因,揭示了通用智能体在真实用户任务上的能力边界。
StartupBench 表明通用智能体在真实市场工作流中完成率仅约 30%,复杂指令遵循和领域知识仍是关键瓶颈。对 FDE 而言,企业交付不能完全依赖通用 Agent;具备领域专长、能将复杂需求转化为可执行工作流的能力仍是核心价值。该基准也可用于评估 Agent 能力边界,辅助设计更务实的交付方案。