AI 新闻中心

AI 新闻中心 过去30天分析了 2388 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

罗永浩批评中国新能源车企 AI 大模型“很垃圾”

中国企业家罗永浩在微博表示,他试驾了数十辆新能源车,却没有发现任何一家车企在车内对话功能中接入豆包、千问或 Kimi 等中国顶级 AI 模型的完整版本。他认为车企可能更倾向于推广自有模型,并直言这些模型的质量不佳。罗永浩称,即使需要额外付费,允许用户使用更优秀的第三方模型也能改善车内体验。相关言论随后迅速登上微博热搜。

努比亚 NaviX Ultra AI 智能体手机获入网许可,预计 9 月上市

努比亚宣布,号称全球首款 AI 智能体手机的 NaviX Ultra 已获得入网许可证,预计 9 月上市。该机将搭载豆包手机助手,支持自然语言理解,并可执行比价、行程规划等多步骤任务。据报道,其接入第三方应用的方式已调整:不再通过读取屏幕和模拟点击来操作应用,而是要求应用自行提供 MCP 服务或可供 AI 调用的接口。努比亚称,大模型核心运算将在手机本地完成,用户数据无需上传云端。关于骁龙 8 E

Uber首席运营官预测:15年后私家车和驾照可能都不再必要

Uber总裁兼首席运营官安德鲁·麦克唐纳表示,15至20年后,人们可能不再需要购买私家车或持有驾照。自行车、电动滑板车、公共交通和自动驾驶汽车将共同满足不同的出行需求。他认为,私家车每天约98%的时间处于闲置状态,同时还会贬值并持续产生保险和维护成本,因此在经济上效率很低。这是一项长期预测,并非已经得到验证的行业趋势。若这一变化发生,可能有利于Uber。该公司正与Waymo、Waabi等企业合作,

香港首个开放环境服务机器人进驻兰桂坊酒吧担任酒保

中国机器人企业智平方科技已将 AlphaBot 2 部署到香港兰桂坊一家酒吧,负责调制鸡尾酒并与顾客互动。据公司介绍,该机器人搭载具身人工智能模型 NeuroVLA,结合语言理解、任务规划和运动控制。智平方称,这套架构可将机器人运动抖动降低 75% 以上,并在发生碰撞后 20 毫秒内作出反应。公司还将其称为全球首个进入酒吧工作的生产力型通用机器人,但相关说法和性能数据尚未经过独立验证。

EvoGenUI-Bench评估大语言模型作为多轮生成式UI助手的能力

EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,

具备不确定性感知能力的端到端AI天气预报区分观测与模型贡献

研究人员将端到端天气预报模型Aardvark Weather扩展为概率模型,分别处理两类不确定性。观测编码器中的输入依赖噪声用于表示地球观测系统带来的不确定性,处理器中的蒙特卡洛 dropout则用于捕捉所学习大气动力学的不确定性。嵌套集成模型能够将预报离散度归因于这两种来源。概率微调使不同变量和预报时效的平均预报表现提升4.2%。模型在中期预报范围内保持良好校准,并在所有预报时效上以CRPS优于

罗永浩痛批车载AI体验太差:为何不直接接入豆包、千问和Kimi?

罗永浩批评新能源车企的车载AI体验普遍不佳。他在试乘数十款车型后表示,没有一家车企接入豆包、千问、Kimi等头部通用大模型。罗永浩认为,车企应与专业AI厂商合作,提升消费者的实际使用体验,即使因此收取额外费用也可以接受。他还呼吁电视行业为老年用户提供更简单的操作方式。相关言论再次引发对车企自研模型与采用第三方模型之间取舍的讨论。

知情人士:抖音推荐算法异常源于服务器故障

9月1日,抖音大量用户反映推荐内容和视频播放出现异常。推荐算法疑似失灵,持续推送与用户偏好不符的低相关度内容,甚至出现数年前的旧视频;部分视频在信息流中反复出现,关注页也无法刷新。视频播放频繁卡顿、长时间加载,在网络连接正常的情况下仍可能错误显示“无网络连接”。据中国媒体援引知情人士消息,此次问题由突发服务器异常引起。抖音客服表示,平台已收到大量类似反馈,正在排查并优化系统,但尚未提供明确的恢复时

Super Library Agent:超越单一代码库的多应用联合生成与维护

该研究提出了 Super Library Agent 问题:基于大语言模型的编程代理需要生成多个相互关联、可独立部署的应用,同时维护一个包含可复用组件的共享库。所提出的方法结合了基于代码摘要的候选引导式提取、提取前的代码库整合,以及利用提取轨迹和调用图信息的上下文感知迁移。在 WebGen-Bench 和 PaperBench 上的评估表明,该方法在保持应用功能的同时,相比零样本方法和简单的库构建