AI 新闻中心

AI 新闻中心 过去一年分析了 1375 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Vercel 开源 Zero:专为 AI Agent 设计、将图作为源码的编程语言

Vercel Labs 已在 GitHub 开源实验性编程语言 Zero,定位是供 AI Agent 使用,而不是主要供人类编写。Zero 将程序语义图作为核心源代码,Agent 通过查询图并提交带有哈希值和预期状态的 patch 来修改程序。编译器会先验证目标节点是否仍处于读取时的状态;如果不匹配,就拒绝写入。文本文件只是方便人类查看的投影,目标是让 Agent 的编辑比基于行号的修改更可靠。项

WorldRover:面向世界探索、带有丰富标注的可扩展合成视频数据引擎

WorldRover 是一套基于 Unreal Engine 的管线,用于在艺术家构建的环境中生成长时段合成探索视频。系统可离线渲染持续数分钟的路线,同时保留完整的相机轨迹和场景几何信息。同一段探索路线可以在第一人称、第三人称和 360 度全景视角下,在不同环境状态中重新播放。研究团队利用该引擎构建了 WorldRover-10M 数据集,将 RGB 视频与度量深度、相机轨迹以及由轨迹推导出的动作

昆仑万维发布 Mureka V9.5,主打更自然的 AI 音乐生成

昆仑万维发布新一代 AI 音乐生成模型 Mureka V9.5,旨在减少 AI 音乐常见的机械感。新版本不再强调高音量和高密度编曲,而是注重克制、留白与结构化的音乐规划。公司表示,其 MusiCoT 框架会在生成音频前,先规划从整体曲式到细节音符表达的音乐逻辑。根据内部评测,模型的人声品质率为 61.0%,Prompt 控制品质率为 97.0%,曲风准确实现率为 95.7%。昆仑万维还表示,模型改

PRISM提升音频文本模型在严重声学噪声下的鲁棒性

该研究提出PRISM,一种无需训练、也无需访问源数据的适应方法,用于应对严重声学噪声下的音频文本模型。PRISM利用冻结的文本原型作为几何锚点,从未标注的目标批次中估计失真,并通过静态投影矩阵进行校正。研究人员称,推理阶段的适应只需进行一次矩阵向量乘法,耗时0.0009毫秒。在UrbanSound8K数据集上,PRISM较零样本基线提升12.94个百分点,并比使用特权噪声信息的测试时适应基线高出9

Anthropic 提及未发布的 Model 2,能力略高于 Claude Mythos 5

Anthropic 在 8 月 15 日发布的风险报告中提到一款尚未发布、名为 Model 2 的 AI 模型。报告称,Model 2 在多项任务上的表现优于 Claude Mythos 5,但提升幅度相对有限,主要体现在综合能力上。报告还提到了 Anthropic 的内部基准测试 CoBench v2,以及 Model 1 这一名称。部分用户据此推测,Model 2 可能是 Model 1 的后

全球首个独立运行的生物集成服务器机架原型亮相

新加坡国立大学医学院联合数据中心开发商 DayOne 和生物计算初创公司 Cortical Labs,发布了全球首个独立运行的生物集成服务器机架原型。首批机架部署 20 个 CL1 生物计算系统,将由人类干细胞培育的活体神经元与硅基硬件、微电极阵列连接,实现实时神经活动。这些神经元能够接收电信号并作出响应,还会随时间逐渐适应。每个 CL1 单元功耗为 30 瓦,内置生命维持系统可让神经元存活最长六

华中地区完成首例全侵入式脑机接口手术,患者可用意念操控轮椅

华中科技大学附属同济医院表示,已完成华中地区首例全侵入式脑机接口手术。一名因高位脊髓损伤导致瘫痪的55岁女性接受了手术,医生将8根超柔性电极植入她的大脑运动皮层。接入外部设备后,她可以通过运动意图操控光标、手机和轮椅。该系统绕过受损的脊髓通路,将神经信号直接转换为外部设备的控制指令。手术并不意味着患者会立即恢复行动能力,后续仍需进行大量闭环训练,以适应新的信号通路。医院还计划评估训练能否帮助患者恢

学习尚未掌握的内容,而非已经掌握的内容:用于多奖励策略优化的饱和感知优势重加权

该研究提出 SA-MRPO,用于具有多个奖励目标的语言模型后训练。不同于采用固定权重的方法,SA-MRPO 分别标准化各个奖励目标,并根据目标的饱和程度,动态降低已经基本达成目标的贡献。这使优化资源转向更困难、仍有提升空间的目标。在数学推理、自适应推理和编程基准测试中,SA-MRPO 在多种设置下优于 GDPO:AIME24 提升最高达 5%,自适应推理平均提升 3.8%,AMC23 最高提升 9

HiFi-BRep:用于稳健B-Rep生成的高保真潜在表示

HiFi-BRep是一种用于生成计算机辅助设计(CAD)边界表示(B-Rep)的深度学习框架。它针对现有方法中的潜在空间填充噪声、特征污染、序列生成误差累积,以及训练与推理不匹配等问题进行改进。拓扑感知编码器通过可学习查询构建更高保真的潜在表示,单阶段解码器则并行预测几何与拓扑,并将可微分的流形约束纳入训练目标。作者报告的实验显示,该方法在结构有效性和几何保真度方面均优于现有先进方法。代码和模型已

哈佛与麻省理工用 83 亿个 AI 智能体模拟人类行为

由哈佛大学和麻省理工学院牵头、OpenAI 与 Google DeepMind 等机构参与的团队推出了 MatrAIx 系统,用于通过最多 83 亿个 AI 智能体模拟人类行为。该系统从 1,290 个维度对不同背景和生活方式的人群进行建模。智能体可以填写问卷、与客服聊天、浏览网页和操作应用。包含 400 次测试的对照研究显示,智能体在 91.5% 的情况下表现出正确特质,或在无关时正确抑制该特质

人形机器人自行驾驶卡丁车,共生知行发布演示

共生知行发布了一段双足人形机器人驾驶卡丁车的演示。公司称,机器人可用右脚控制油门,并在驶出弯道前结合视觉时机判断、精准油门控制和快速转向。该公司由浙江大学与西湖大学联合培养的博士生创立,专注于具身智能的端到端动作生成。其“直接感知—控制模型”取消了中间运动表征,将视觉、语言、身体状态、动作历史和执行反馈直接映射为可执行的关节与手部目标。此次卡丁车驾驶属于技术概念验证,尚不能证明人形机器人已经具备可

AnyTalk:利用视频生成模型为任意角色生成语音动画

AnyTalk是一种为任意角色生成3D语音动画的方法,无需动画数据或繁琐的绑定与重新建模。该系统利用角色渲染图像,将预训练的视频扩散模型适配到目标角色,再通过估计blendshape参数,将生成的说话头像动作转换为3D动画。该方法可针对不同面部网格和blendshape配置生成唇形同步动画,并减少人工工作和数据需求。研究团队还将AnyTalk蒸馏为支持实时运行的AnyTalk_RT版本,代码已公开

并非被准入,而是被聚集:注意力如何让潜变量变得可语言表达

一项针对开放权重语言模型的研究,探讨潜在信息如何转化为模型能够报告的形式。研究人员使用雅可比透镜,在共享相同上下文的基准任务上进行测试,未发现预测中的独立“闸门”机制。相反,注意力机制会在模型中等深度的区域聚集信息,使变量能够在查询位置被读取。这种效果取决于任务需求,并在两种不同架构中出现在相近的相对深度。研究定位了变量变得可读的位置,但没有揭示信息传输的完整路径。研究还指出,探针测得的可见性并不

先前的审计与修复上下文使LLM验证器的判定阈值趋于宽松

一项研究分析了在自动检查流程中由一个语言模型充当验证器、另一个或同一个模型负责修复时,先前的上下文是否会改变检查结果。在字节完全一致的任务中,预先加入一次审计与修复过程后,所有15种模型与措辞组合的误报率都下降了2.8至11.5个百分点。对于其中一个模型,审计曾报告错误的过程会进一步减少误报。信号检测分析表明,变化来自判定阈值移动,而不是辨别能力下降。人工检查50个误报后发现,82%确实是错误警报

HarnessEval-W:用智能体评估视觉世界

HarnessEval-W 是一套面向世界模型的智能体评估流程。它不再只输出单一分数,而是将每个评估问题拆解为可测量的子问题,并为各个子问题配置具有专属上下文和诊断工具的专业子智能体。上级智能体会验证收集到的证据并生成最终结论,从而形成透明的证据树。该方法在 18 个代表性世界模型的 330 个评估案例上进行了测试,判断结果与人类偏好高度一致,同时能够细致诊断物理规律、因果关系和世界状态演变方面的