Hugging Face · Daily Papers

MerchantBench:评估LLM智能体在电商运营中的长期连贯性

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu 等 13 位
来自 alibaba
二〇二六年八月五日 · arXiv:2607.28956 · PDF · Code

大语言模型智能体正越来越多地被评估为自主工具使用者,然而大多数基准测试聚焦于具有即时成功标准的受限任务。现实世界中的部署往往需要长期连贯性(Long-Term Coherence),即在长时间跨度内保持有目的的行为,同时根据累积证据调整决策的能力。评估这一能力需要一个持久的环境,其中行动会约束未来的选择,反馈以异质延迟到达,且不连贯的行为会产生可衡量的累积效应。卖方侧电子商务通过产品采购、列表与定价控制、现金流管理以及混合延迟反馈适应中的循环和相互依赖决策,为这种评估提供了合适的场景。我们引入了MerchantBench,一个基于98,843条真实电子商务产品记录、配备26个工具供智能体交互的365天订单级模拟。MerchantBench将可即时观察的上游供应商事件与延迟的下游订单结果相结合,要求智能体跟踪单个订单生命周期并重新审视早期决策。我们在两种智能体框架下对八个大语言模型进行了48次运行评估,每次运行跨越365个模拟日。结果显示,即使是最新的大语言模型与人类参与者之间仍存在显著差距,最佳大语言模型配置仅达到人类参与者平均最终净资产的27.3%。

译自 Hugging Face · Daily Papers · arXiv:2607.28956 · 录于 二〇二六年八月五日