评估超越首轮提示的智能体
Evaluating Agents Beyond the First Prompt
摘要
EvoCode-Bench 在持久化工作区中设计了227个连续轮次的测试,用于评估编码agent的可靠性。实验发现,单轮得分会高估agent的真实表现,真正的性能瓶颈在于回归(regression)问题,而非功能缺失。
EvoCode-Bench 在持久化工作区中,通过 227 个连续轮次测试编码 agent。单轮得分高估了可靠性——真正的瓶颈是回归(regression),而非功能缺失。
译自 Philipp Schmid · 博客 · 录于 二〇二六年七月二十七日