E-Commerce Bench 评估大语言模型智能体执行长期自主商业运营的能力
E-Commerce Bench 是一个开源基准,用于评估大语言模型智能体在动态年度商业模拟中的表现。智能体需要同时运营多家网店,开展市场调研,与供应商谈判,优化销售策略,处理订单和退货,并管理现金流。模拟环境包括促销活动、自然灾害和供应链冲击。研究团队从七个维度评估了18个前沿模型,结果显示没有任何模型在所有领域都占据优势。GPT-5.6 Sol 将10万初始资金增至1,431,425,期末资产最高,但在防范欺诈方面排名18个模型中的第16位。在开放权重模型中,Qwen3.8-Max-Preview以416,252领先,并在持续谈判中展现出最强的学习改进能力。代码已在GitHub上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。