AI 新闻中心

AI 新闻中心 过去30天分析了 4647 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

LoopArena:评估模型作为循环工程运行时控制器的基准测试

LoopArena是一项用于评估模型的基准测试,研究模型如何在长期软件工程任务中指导独立的编码代理。每轮编码结束后,控制器会收到运行过程的结构化摘要,并决定工作代理下一步应执行或验证的内容,或者是否应该停止。该基准测试涵盖三种执行范围和成本设置。在完整任务中,观测到的最高严格成功率为24.69%,表明长期循环控制仍有较大改进空间。同时,受评估的控制器平均将估计推理成本降低了64.4%。研究人员已公

如何解决智能体泛滥问题

SaaS 应用的无序扩张曾让许多企业措手不及。为避免重蹈覆辙,各组织应从现在开始建立针对 AI 智能体的治理、监督和管理机制,在其使用变得分散且难以控制之前采取行动。

欧盟将 ChatGPT、Reddit 和 Roblox 纳入《数字服务法》监管

欧盟委员会依据《数字服务法》(DSA),正式将 ChatGPT、Reddit 和 Roblox 列为监管对象。三项服务在欧盟的月均活跃用户数均超过 4500 万,达到法定门槛。ChatGPT 被认定为超大型在线搜索引擎,Reddit 和 Roblox 则被认定为超大型在线平台。相关企业必须履行更严格的义务,包括风险评估、内容审核和透明度报告。欧盟委员会表示,ChatGPT能够与用户互动、响应提示词

地平线机器人2026年上半年归母净利润37.84亿元,同比扭亏为盈

中国车载人工智能芯片和自动驾驶解决方案供应商地平线机器人公布,2026年上半年营业收入为20.55亿元,同比增长32.9%;毛利润为13.56亿元,同比增长32.9%,毛利率维持在66%。归属于母公司股东的净利润为37.84亿元,较上年同期由亏转盈。授权及服务业务收入同比增长52.7%,占总收入的55%。公司预计未来12个月继续提升市场份额,并于2026年第四季度推动舱驾融合整车智能解决方案量产;

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

生成式视觉语言模型即使面对仅在感知种族或性别等受控属性上存在差异的图像,也可能生成带有人口统计偏见的内容。GGSS是一种推理时去偏方法,它在单位超球面上发现反事实偏见子空间,沿测地线弧线调整视觉标记,并自适应地重点修正携带更强人口统计信号的标记。在四个生成式视觉语言模型和十种对比方法上的评估中,GGSS在全部四个模型上取得了最低的平均偏见;其中三个模型骨干上的改进具有统计显著性。同时,MMStar