AI 新闻中心

AI 新闻中心 过去24小时分析了 159 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

香港首个开放环境服务机器人进驻兰桂坊酒吧担任酒保

中国机器人企业智平方科技已将 AlphaBot 2 部署到香港兰桂坊一家酒吧,负责调制鸡尾酒并与顾客互动。据公司介绍,该机器人搭载具身人工智能模型 NeuroVLA,结合语言理解、任务规划和运动控制。智平方称,这套架构可将机器人运动抖动降低 75% 以上,并在发生碰撞后 20 毫秒内作出反应。公司还将其称为全球首个进入酒吧工作的生产力型通用机器人,但相关说法和性能数据尚未经过独立验证。

EvoGenUI-Bench评估大语言模型作为多轮生成式UI助手的能力

EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,

推理模型的思维链忠实度会因偏好线索的传递位置和方式而变化

一项研究推出了 FACE-Eval,使用5,100个样本评估思维链(CoT)记录是否忠实反映影响模型回答的信息。研究测试了来自8个模型系列的15个开放权重模型,参数规模从40亿到1.60万亿不等。所有模型在接收工具返回内容中的偏好线索时,明确表达受影响程度都低于接收用户消息中的线索,但未明确表达却采纳偏好的比例更高。从原始数据中推断出的隐性线索也呈现类似结果。要求模型标注信息来源的提示,在7个模型

具备不确定性感知能力的端到端AI天气预报区分观测与模型贡献

研究人员将端到端天气预报模型Aardvark Weather扩展为概率模型,分别处理两类不确定性。观测编码器中的输入依赖噪声用于表示地球观测系统带来的不确定性,处理器中的蒙特卡洛 dropout则用于捕捉所学习大气动力学的不确定性。嵌套集成模型能够将预报离散度归因于这两种来源。概率微调使不同变量和预报时效的平均预报表现提升4.2%。模型在中期预报范围内保持良好校准,并在所有预报时效上以CRPS优于

中国公布8月违规“AI魔改”视频治理成果:清理近1.4万条视频

中国主要网络视听平台公布2026年8月“AI魔改”视频专项治理结果,共清理违规视频近1.4万条,处置违规账号30余个。抖音处置2897条,快手2824条,微信2633条,哔哩哔哩800余条,小红书1348条,百度3424条;微博拦截并清理37条。小红书另处置违规账号25个,百度禁言账号7个。国家广播电视总局要求平台加强日常巡查,重点清理基于四大名著、历史题材、革命题材、英模人物等经典内容进行不当A

罗永浩痛批车载AI体验太差:为何不直接接入豆包、千问和Kimi?

罗永浩批评新能源车企的车载AI体验普遍不佳。他在试乘数十款车型后表示,没有一家车企接入豆包、千问、Kimi等头部通用大模型。罗永浩认为,车企应与专业AI厂商合作,提升消费者的实际使用体验,即使因此收取额外费用也可以接受。他还呼吁电视行业为老年用户提供更简单的操作方式。相关言论再次引发对车企自研模型与采用第三方模型之间取舍的讨论。

知情人士:抖音推荐算法异常源于服务器故障

9月1日,抖音大量用户反映推荐内容和视频播放出现异常。推荐算法疑似失灵,持续推送与用户偏好不符的低相关度内容,甚至出现数年前的旧视频;部分视频在信息流中反复出现,关注页也无法刷新。视频播放频繁卡顿、长时间加载,在网络连接正常的情况下仍可能错误显示“无网络连接”。据中国媒体援引知情人士消息,此次问题由突发服务器异常引起。抖音客服表示,平台已收到大量类似反馈,正在排查并优化系统,但尚未提供明确的恢复时

Super Library Agent:超越单一代码库的多应用联合生成与维护

该研究提出了 Super Library Agent 问题:基于大语言模型的编程代理需要生成多个相互关联、可独立部署的应用,同时维护一个包含可复用组件的共享库。所提出的方法结合了基于代码摘要的候选引导式提取、提取前的代码库整合,以及利用提取轨迹和调用图信息的上下文感知迁移。在 WebGen-Bench 和 PaperBench 上的评估表明,该方法在保持应用功能的同时,相比零样本方法和简单的库构建

Chat-Edit-3D++:利用大语言模型进行交互式3D与4D场景编辑

这项研究提出了CE3D++,一个利用大语言模型对3D场景和单目4D场景进行对话式编辑的系统。其Hash-Atlas网络将2D图像编辑与3D重建流程解耦。LLM能够理解用户的自由格式文本指令,并自主调用合适的视觉模型。针对4D场景,研究加入了运动物体约束,并构建了与编辑任务相关的轨迹数据集。据研究人员介绍,较小的LLM可以准确调度最多30种视觉工具。实验显示,该系统支持多样化的编辑效果、场景理解和多