AI 新闻中心

AI 新闻中心 过去7天分析了 930 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

CPI-Bench:面向真实世界图像编辑的综合实用基准

CPI-Bench是一项用于评估AI图像编辑模型的新基准,重点测试模型在真实应用场景中的表现。它包含三个子集:覆盖多种编辑任务并首次纳入多图像编辑评估的CPI-General-Bench,聚焦高频用户场景的CPI-Practical-Bench,以及评估高难度推理式编辑能力的CPI-Intelligent-Bench。对主流图像编辑模型的评估表明,该基准能够更有效地区分模型在通用编辑、实际部署和高

报道称 SpaceX 以600亿美元收购 AI 编程公司 Cursor

文章声称,SpaceX 在4月启动合作后收购了 AI 编程助手 Cursor。报道称,交易将使 Cursor 获得大规模算力基础设施,用于开发性能更强、成本更低的 AI 模型。Grok 4.6 被描述为双方团队的首项联合成果。不过,文章关于收购事实、交易估值以及可用 GPU 基础设施规模的多项关键说法目前未经证实。

Codex 向所有符合条件的用户开放百万 Token 上下文窗口

OpenAI 已向符合条件的 ChatGPT 账户开放 Codex 约 105 万 Token 的上下文窗口。此前,这项能力仅限通过 API 调用,Plus 和 Pro 订阅用户需要手动配置后才能使用。更大的上下文窗口可以让编程代理在自动压缩历史信息前,处理更多代码、工具输出和完整对话记录,有助于大型代码库重构、复杂调试和长时间开发会话。OpenAI 同时提醒,默认上下文长度是在性能与成本之间权衡

HumanTracker:迈向全面且符合人类评价的动作跟踪基准

HumanTracker是一项用于评估人形机器人动作跟踪能力的基准,旨在让评估结果更符合人类对视频的感知。传统运动学指标通常计算逐帧姿态差异的平均值,却难以捕捉支撑不稳定、脚部滑动和落地时机错误等关键物理问题。该基准收集了来自多名专业表演者的约153小时光学动作轨迹,分为四类动作,并配有文本标签以支持细致诊断。研究人员还提出了HumanScore指标,该指标使用由1.2万组动作对、共2.4万个动作

扩展大语言模型预训练中的领域数据重复使用

随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次

小米汽车 App“车辆助手”开启公测招募

小米汽车正在招募车主体验 App 内的“车辆助手”公测功能。用户可以通过自然语言对话查询车辆状态、即时或定时控制车辆、创建自定义“超级任务”,并分析驾驶风格和用车习惯。该功能还支持出行前提前开启空调、规划自驾路线,以及查询保养权益和车辆功能。目前功能仍处于测试迭代阶段,首批体验名额有限,所有车主均可报名并由官方筛选。参与测试无需更新车机,只需按照指引将小米汽车 App 升级至公测版本。

40亿次播放、粉丝超百万:中国人形机器人走红全球社交媒体

中国企业宇树科技生产的一款人形机器人正在全球社交媒体上受到关注。身高约1.3米的“爱德华”接入大语言模型后,可以用波兰语与人实时对话。其拥有者表示,机器人开始说话后,路人的接受度明显提高。爱德华曾进入波兰议会、参加户外活动,并出现在一段于华沙追逐野猪的热门视频中。据报道,相关视频累计播放量超过40亿次,粉丝数超过100万。其他Unitree G1机器人也在美国等地成为网络红人。该型号相对容易购买且

通过主张级可靠性评估提升测试时推理效率

研究提出了主张级可靠性评估(Claim-Level Reliability Assessment,CLR),这是一种无需额外训练、旨在更高效利用推理时计算资源的方法。CLR不再生成更多完整解答,而是从推理轨迹中提取对决策至关重要的主张,并针对性地检查其中是否存在决定性错误。该方法利用了一个不对称性:构建正确解答需要一条完全无误的推理路径,而反驳错误主张只需找到一个决定性缺陷。在四个大语言模型和四个

我们能否防御针对现实危机事件的人工智能生成视频攻击?

这项研究提出了 RA-Bench,这是一个用于检测描绘现实危机事件的人工智能生成视频的基准数据集。数据集共包含17,886段视频:来自10类社会风险的1,830段真实参考视频,以及由4个开源和5个闭源生成器制作的16,056段生成视频。研究评估了7种传统检测器、10个零样本多模态模型,以及2个专门针对人工智能生成视频检测进行微调的模型。结果显示,三类检测器都无法在整个基准上实现稳定泛化。生成质量、

鸿蒙智行尊界 V800、V680 获合肥市 L3 级自动驾驶测试牌照

鸿蒙智行尊界 V800 和 V680 已获准在合肥市开展 L3 级自动驾驶测试,后续将针对多种驾驶场景进行深度测试。两款车型搭载华为 ADS 5.0 全栈软硬件方案,并对传感器、计算系统、连接系统和电源进行冗余设计。车辆预计于 9 月开始交付。此次牌照仅允许开展测试,并不等同于获得在公共道路上不受限制运行 L3 自动驾驶系统的许可。

不再仅限 API 密钥:Codex 的 GPT-5.6 Sol 百万 Token 上下文现可通过 ChatGPT 账号使用

OpenAI 已将 Codex 中 GPT-5.6 Sol 约 100 万 Token 上下文窗口的使用范围扩展至 ChatGPT 账号。该功能此前仅支持 API 密钥,现在 ChatGPT Plus、Pro 等订阅用户也可以手动启用。更大的上下文窗口可让 Codex 在压缩早期信息前保留更多代码、工具输出和对话记录,适用于大型代码库重构、复杂调试和长时间会话。OpenAI 表示,默认上下文长度是

千问办公首发上线GLM-5.3与DeepSeek V4Pro,聚合三款国产旗舰模型

阿里巴巴旗下AI Agent产品“千问办公”于8月14日宣布接入智谱GLM-5.3和DeepSeek V4Pro,用户可在首页“前沿模型”栏目直接选择。加上此前已接入的Qwen3.8-Max,平台现已覆盖阿里巴巴、智谱和DeepSeek三家的旗舰模型。DeepSeek V4Pro据称支持100万Token上下文和最高38.4万Token输出,重点面向长程任务与Agent任务串联。GLM-5.3则据

Dion3:实现全栈正交更新优化

Dion3是Muon优化器的改进版本,旨在降低Newton-Schulz正交化步骤带来的计算和通信开销。其Gram Newton-Schulz算法减少了FLOP成本,优化后的CuteDSL内核利用对称性提升速度,批量合并策略则降低分布式训练中的通信开销。此外,新的更新规则每一步只对动量矩阵的一部分行进行正交化。作者称,Dion3在损失表现上可达到或优于Muon,同时将优化器单步耗时最多缩短6倍。该