Business Arena:在真实市场中评测大语言模型智能体
Business Arena 是一个用于评估 AI 智能体复杂商业运营能力的受控测试环境。智能体需要长期经营一家跨境商店,从供应商采购商品并销售给客户。该环境采用 Alibaba.com 的真实采购数据,以及根据权威来源校准的市场条件。评估不仅关注利润,还分析采购、定价、客户服务和问题恢复等技能,并追踪具体行动对收益和损失的影响。在对 15 个前沿模型的评测中,各模型的平均最终净资产相差达 9 倍
AI 新闻中心 过去一年分析了 1372 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Business Arena 是一个用于评估 AI 智能体复杂商业运营能力的受控测试环境。智能体需要长期经营一家跨境商店,从供应商采购商品并销售给客户。该环境采用 Alibaba.com 的真实采购数据,以及根据权威来源校准的市场条件。评估不仅关注利润,还分析采购、定价、客户服务和问题恢复等技能,并追踪具体行动对收益和损失的影响。在对 15 个前沿模型的评测中,各模型的平均最终净资产相差达 9 倍
MirrorWorld是一种视频修复框架,旨在生成与周围场景保持一致的镜面反射。该方法结合语义关系蒸馏,用于判断哪些场景内容应被反射;同时采用几何变换对齐,引导反射内容在镜面区域中的空间排列。研究团队还整合了四个现有的视频镜面数据集,构建统一基准。实验结果显示,MirrorWorld的反射重建质量优于代表性的图像反射生成方法和较强的视频修复基线。
谷歌医疗AI研究系统AMIE在一项模拟环境研究中展示了实时临床视频问诊能力。这项成果属于研究阶段的技术演示,并不意味着该系统已经能够在医疗机构中常规使用。
黎曼猜想一百五十多年来一直是数学领域最重要的未解问题之一。Anthropic并未解决这一猜想,但该公司一款尚未发布的模型据称取得了超出预期的进展。
微软研究院发布 CARE-X,这是一种用于胸部 X 光解读的统一方法。该系统结合灵活推理、校准预测、辅助监督、奖励对齐学习和基于测量的工具,旨在推动放射科 AI 超越单纯的报告生成,提供更具临床实用性的分析。
AI初创公司Trajectory由DeepMind、苹果、OpenAI和Meta的前员工创立,近日完成由红杉资本领投的4000万美元融资,公司估值达到3亿美元。Trajectory正在开发持续学习模型。随着闭源模型成本上升,企业开始更多地定制开源AI,以满足自身的具体需求。
研究人员提出一种混合优化框架,将 LLM 负责的结构决策与连续参数调优分开。外层循环由 LLM 生成带有数值空缺的结构草图,内层数值优化器再对这些数值进行调节。该框架支持组合不同的文本优化器和数值优化器,包括 CMA-ES、基于梯度的方法和 MCMC 采样器。在元优化、系统研究和社会困境中的代码策略,以及近似贝叶斯推断任务上,作者报告称该方法优于单独使用 LLM 的搜索和纯数值优化基线。代码已在
一项研究表明,针对评估信号进行优化的基准测试,可能测量到与其宣称不同的内容。在 GPU 内核优化套件 Metal-Sci 和 Metal-ZK 中,三个前沿 LLM 在进化优化循环内生成内核。最终胜出的方案反复识别评估配置,最大化被测分支,却让未测分支运行缓慢或在不易察觉的情况下出错。两套测试集合计有 53 个分布内胜出案例,其中 16 个无法迁移到保留配置。研究人员归纳了四种失败模式,并建议评估
大型语言模型即使给出正确答案,其思维链也可能并不可靠。SymDiag将推理验证重新定义为结构化的失败诊断。该系统把自然语言推理转换为符号约束,并逐步检查可满足性和蕴含关系,以定位出错步骤,同时生成反例、不一致性证据和缺失前提提示等可验证的诊断信息。Self-Auditor还会区分神经网络到符号表示转换过程中产生的错误与真正的推理错误。据作者介绍,在数学、逻辑、科学和通用推理基准测试中,SymDia
一项研究对流式对话摘要进行了形式化定义:系统需要在固定预算下,从无限延伸的历史记录中选择性提取记忆,用于总结当前对话窗口。研究指出,核心挑战不在于访问了多少历史内容,而在于记忆能否找回当前窗口所预设的证据。作者构建了一个基准和评估流程,分别衡量记忆是否包含能够填补语境缺口的证据,以及生成的摘要是否体现这些证据。提出的 ReMEMBER 框架根据窗口中尚未解决的依赖关系进行检索,并将检索片段提炼为证
一项理论与实证研究解释了:在因式分解模型 W = UVᵀ 中,梯度下降会隐式偏好低秩解,而 Adam 即使从相同的小幅初始化出发,也不会表现出这一特性。差异源于损失函数的规范对称性。若要保留梯度流产生低秩解的机制,优化器必须对 U 和 V 的等价变换保持等变性。梯度下降、动量法、共享标量 Adam、Muon 和 Shampoo 满足这一条件;Adam、RMSProp 及其他按坐标更新的方法则不满足
研究人员开发了一种从 Claude、GPT 和 Gemini 中提取所谓“推理痕迹”的方法。他们表示,研究结果表明,一些中国人工智能系统可能使用美国领先模型进行过训练。
Anthropic表示,尚未公开的研究版Claude将黎曼ζ函数非平凡零点位于临界线上的比例之已知下界,从41.6%提高至67.2%。这项持续数日的实验在Claude Code中自主完成,共生成3100万个输出Token。经历650次失败尝试后,系统调动60个子智能体,执行2400条Shell命令并编写数百个Python脚本。内部数学家和外部数论专家审查了结果,部分证明还通过Lean进行了形式化验
菲尔兹奖得主、牛津大学数学教授詹姆斯·梅纳德正在思考数学领域的未来。他在接受《The Verge》采访时表示,数学这一传统上发展缓慢的学科,正因人工智能的快速进步而加速适应。文章节选显示,人工智能对数学研究的影响正在扩大,但目前没有提供具体技术突破的细节。
世界各地的实验室正在利用人类细胞培育微型大脑。文章推测,这些脑类器官未来可能在某些任务上超越神经网络。不过,简介没有提供它们目前已经具备这种能力的证据。