AI 新闻中心

AI 新闻中心 过去一年分析了 7916 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

潜在在线策略自蒸馏

该研究提出潜在在线策略自蒸馏(LOPD),旨在帮助 AI 智能体将经验直接融入自身策略。LOPD 不依赖设计者预先制定的特权信息,而是端到端学习这类上下文:系统检索相关经验,并将其组合为连续潜在 token,用于调节自教师模型。学生模型根据任务和交互历史生成轨迹,并在每个访问过的前缀位置获得密集的 token 级监督。研究还引入特权边际目标,以提升训练稳定性。在智能体工具使用和代码生成实验中,LO

AI视频生成平台Higgsfield获高盛、英特尔等4亿美元融资,估值达54亿美元

据英国《金融时报》报道,AI视频生成平台Higgsfield已从DST Global、高盛、Liberty Global、英特尔等投资者手中筹集4亿美元,估值升至54亿美元。这家成立仅两年的初创公司计划利用资金拓展企业订阅业务,加强安全能力并 확보算力资源。Higgsfield称,其年化收入在今年8月达到7亿美元,约一年前仅为2000万美元;平台目前在238个国家和地区拥有超过3000万用户。公司

MobileMem:从一年的移动体验中学习

MobileMem 是一个用于研究设备端 AI 智能体长期记忆的基准和框架。它基于为期一年的移动体验数据,并通过知识驱动的合成流程,从用户与应用的交互会话中构建连贯且具有时间一致性的长期轨迹。该基准涵盖文本和多模态场景,评估多跳推理与时间推理、知识更新以及隐式偏好推断。MobileMem 不仅关注对孤立事实的检索,还评估智能体能否记住过去、理解现在,并随着时间推移适应用户。

PRM-as-a-Judge 1.5:机器人流程评估工具包

PRM-as-a-Judge 1.5是一套用于精细评估机器人操作流程的工具包。它将执行视频转换为密集的进度曲线,并提供衡量失败过程进展、性能下滑后恢复能力以及成功执行质量的多项指标。项目还推出RoboPulse++,用于测试流程奖励模型的可靠性。该套件包含基准测试、指标实现和可视化工具,支持对具身模型进行透明且可复现的评估。

支持澳大利亚青少年社交媒体禁令的报告存在多处引用错误,机构承认曾用 ChatGPT 编辑

一份旨在评估年龄验证技术、协助澳大利亚执行未满16岁用户社交媒体禁令的报告,被发现至少存在6处引用错误。负责测试的英国机构 Age Check Certification Scheme(ACCS)承认,曾使用 ChatGPT 改写部分段落以使表述更简洁,此前该机构一度否认使用人工智能。ACCS称,AI没有用于生成研究、报告或参考文献,所有链接都经过人工核查。但《卫报》发现,部分 DOI 不存在或指

研究显示,仍具活性的成人脑组织可控制机械手弹奏音符

法国研究团队称,他们将取自已故成年人的活性脑组织接入了由电极、麦克风和机械手组成的闭环系统。这些被称为 OPAB 的脑组织外植体接受训练,将三个音符与三根机械手指的动作建立关联。在 16 个样本中,平均模仿准确率从第一天的 31.2% 提升至训练三天后的 58.5%。其中 62.5% 的样本至少学会了两个音符,部分关联在 17 天后仍然保留。研究人员认为,这种能力源于脑组织内部神经连接的变化,而不

将生成作为辅助监督,在不增加推理开销的情况下提升视觉理解

该研究提出GAS,一种面向多模态大语言模型的训练框架,将视觉生成重新定义为表征学习的辅助监督。GAS在解耦的Mixture-of-Transformers架构中采用下一嵌入预测,通过生成任务增强共享视觉路径,同时避免生成梯度直接干扰上层理解模块。训练完成后,生成分支会被移除,因此推理阶段无需额外计算。实验表明,GAS能够提升多模态理解能力,其中在视觉感知和空间理解方面的收益最为稳定。

CPI-Bench:面向真实世界图像编辑的综合实用基准

CPI-Bench是一项用于评估AI图像编辑模型的新基准,重点测试模型在真实应用场景中的表现。它包含三个子集:覆盖多种编辑任务并首次纳入多图像编辑评估的CPI-General-Bench,聚焦高频用户场景的CPI-Practical-Bench,以及评估高难度推理式编辑能力的CPI-Intelligent-Bench。对主流图像编辑模型的评估表明,该基准能够更有效地区分模型在通用编辑、实际部署和高

报道称 SpaceX 以600亿美元收购 AI 编程公司 Cursor

文章声称,SpaceX 在4月启动合作后收购了 AI 编程助手 Cursor。报道称,交易将使 Cursor 获得大规模算力基础设施,用于开发性能更强、成本更低的 AI 模型。Grok 4.6 被描述为双方团队的首项联合成果。不过,文章关于收购事实、交易估值以及可用 GPU 基础设施规模的多项关键说法目前未经证实。

Codex 向所有符合条件的用户开放百万 Token 上下文窗口

OpenAI 已向符合条件的 ChatGPT 账户开放 Codex 约 105 万 Token 的上下文窗口。此前,这项能力仅限通过 API 调用,Plus 和 Pro 订阅用户需要手动配置后才能使用。更大的上下文窗口可以让编程代理在自动压缩历史信息前,处理更多代码、工具输出和完整对话记录,有助于大型代码库重构、复杂调试和长时间开发会话。OpenAI 同时提醒,默认上下文长度是在性能与成本之间权衡

HumanTracker:迈向全面且符合人类评价的动作跟踪基准

HumanTracker是一项用于评估人形机器人动作跟踪能力的基准,旨在让评估结果更符合人类对视频的感知。传统运动学指标通常计算逐帧姿态差异的平均值,却难以捕捉支撑不稳定、脚部滑动和落地时机错误等关键物理问题。该基准收集了来自多名专业表演者的约153小时光学动作轨迹,分为四类动作,并配有文本标签以支持细致诊断。研究人员还提出了HumanScore指标,该指标使用由1.2万组动作对、共2.4万个动作

扩展大语言模型预训练中的领域数据重复使用

随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次

小米汽车 App“车辆助手”开启公测招募

小米汽车正在招募车主体验 App 内的“车辆助手”公测功能。用户可以通过自然语言对话查询车辆状态、即时或定时控制车辆、创建自定义“超级任务”,并分析驾驶风格和用车习惯。该功能还支持出行前提前开启空调、规划自驾路线,以及查询保养权益和车辆功能。目前功能仍处于测试迭代阶段,首批体验名额有限,所有车主均可报名并由官方筛选。参与测试无需更新车机,只需按照指引将小米汽车 App 升级至公测版本。

40亿次播放、粉丝超百万:中国人形机器人走红全球社交媒体

中国企业宇树科技生产的一款人形机器人正在全球社交媒体上受到关注。身高约1.3米的“爱德华”接入大语言模型后,可以用波兰语与人实时对话。其拥有者表示,机器人开始说话后,路人的接受度明显提高。爱德华曾进入波兰议会、参加户外活动,并出现在一段于华沙追逐野猪的热门视频中。据报道,相关视频累计播放量超过40亿次,粉丝数超过100万。其他Unitree G1机器人也在美国等地成为网络红人。该型号相对容易购买且

通过主张级可靠性评估提升测试时推理效率

研究提出了主张级可靠性评估(Claim-Level Reliability Assessment,CLR),这是一种无需额外训练、旨在更高效利用推理时计算资源的方法。CLR不再生成更多完整解答,而是从推理轨迹中提取对决策至关重要的主张,并针对性地检查其中是否存在决定性错误。该方法利用了一个不对称性:构建正确解答需要一条完全无误的推理路径,而反驳错误主张只需找到一个决定性缺陷。在四个大语言模型和四个