AI 新闻中心

AI 新闻中心 过去30天分析了 913 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

据称全球首例:AI超声机器人引导完成先天性心脏病封堵术

9月5日,中国人民解放军总医院第六医学中心宣布完成一例在AI超声机器人引导下进行的先天性心脏病介入封堵术,并称这是该类智能技术首次用于临床。患者为48岁男性,确诊房间隔缺损,因缺损边缘解剖条件较差,曾被多家医院建议接受开胸手术。该系统由第六医学中心团队与清华大学科研团队联合研发,可自主完成超声扫查,利用算法识别病灶、勾勒缺损边界,实时构建心脏三维模型,并辅助规划封堵器植入路径。院方表示,机器人在术

得州大举兴建数据中心,大学毕业生失业率却上升

达拉斯联邦储备银行研究人员发现,在人工智能快速发展的过程中,得州大学毕业生的失业率升至异常高的水平。自 ChatGPT 发布以来,受 AI 影响较大的行业招聘职位明显减少。2025 年第一季度,受影响较大的职位招聘数量下降约 8%,而受影响较小的职位变化不大。与此同时,得州也是全美在建数据中心最多的州。路透社分析称,数据中心及其他大型用电企业申请接入该州电网的电力需求,已从 2023 年约 48

《美国医学会杂志》论文称 AI 已超越人类医生,引发行业反对

《美国医学会杂志》发表的一篇论文在梳理数百项研究后称,AI 在多项基础医疗任务上的表现可能已经超过医生,未来不久甚至能够独立照护患者。作者认为,在认知性医疗工作中,AI 单独提供服务的效果可能优于医生单独诊疗,或医生与 AI 共同诊疗。不过,许多医生和美国医学会对此提出质疑,指出部分引用研究只是模拟实验,并非盲法临床试验,另有研究结果与论文结论相矛盾。论文还提出,随着 AI 进步,人类医生的介入可

小米开源表格数据模型 TabLDM:四大基准评测进入第一梯队,OpenML-CTR23 回归排名第一

小米已开源通用表格数据基础模型 Xiaomi-TabLDM。该模型完全基于结构因果模型生成的大规模合成数据进行预训练,旨在无需针对每个数据集重新训练或调参,即可完成分类和回归任务。其架构采用双流特征分组、轻量级 Attention Residual、稀疏混合专家和 Test-Time Scaling。根据小米公布的评测结果,TabLDM 在 OpenML-CTR23 回归任务中排名第一,并在 TA

VeriPhy:用于世界模型评估与改进的代理式物理推理

VeriPhy是一套可审计系统,用于评估人工智能生成视频的物理可靠性。在观察任何画面之前,文本规划器会将提示词转换为带类型的物理约束和经过静态验证的执行计划。执行过程中,系统只根据观测结果调用预先指定的低级专家,处理分割、跟踪、计数、深度估计、OCR和音频事件检测等任务。每个判定都保留证据来源,并被归类为支持、矛盾或未知。该系统基于1500段由人工标注、记录生成缺陷的视频。在包含304条缺陷记录的

RoboTok:面向人类示范检索与灵巧操作学习的互联网规模数据引擎

RoboTok从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人的操作策略。系统根据以行为主体为中心的三维手部轨迹学习潜在运动空间,使其能够在摄像机视角、场景外观和遮挡情况不同的条件下比较操作行为,同时支持对大规模视频集合进行高效搜索和持续索引。评估显示,RoboTok检索到的示范比现有方法更相关,并提升了机器人在后续操作任务中的成功率。

语音脑机接口的通用通信能力衡量标准

一项研究提出了开放词汇互信息(OVMI),这是一种基于信息论的指标,可在统一尺度上比较语音脑机接口。由于不同系统使用的数据集、记录方法、语音类型和词汇各不相同,现有性能数据难以直接比较。OVMI同时考虑用户可能希望表达的词语分布,以及解码器能够传递的信息量。研究显示,只针对系统支持的词语计算准确率和词错误率,可能高估系统实际传达用户意图的能力。通过选择能够最大化OVMI的词汇,在三个语音领域中,相

优化中的渗流动力学:方差级联与离散尺度不变性

该研究分析了随机梯度下降(SGD)的动力学。SGD 已知会将深度神经网络引导至与更简单子网络相对应的不变集合。研究人员将随机梯度流建模为渗流过程:架构对称性使子网络以离散且同步的区块合并,而不是逐个合并。这些结构转变会在宏观序参量中表现为方差尖峰,类似物理学中的相变。在明确的重尾噪声模型下,研究还表明,这种俘获机制及其相关的尺度级联可以扩展到 Adam 和 AdamW。

Last Translation Benchmark 挑战最新翻译模型的能力极限

Last Translation Benchmark(LTB)是一套由人类编写并经过同行评审的文本、图像、音频和视频集合,用于揭示主流机器翻译模型的失败案例。随着传统翻译基准逐渐接近饱和,自动评估指标容易受到奖励劫持影响,也难以提供可执行的改进方向。LTB为每个样例配备人工制定的验证规则,具体说明可能出现的错误,从而支持更可靠、可复现且具有实际指导意义的后续评估。该基准是一个持续更新并接受新贡献的

OpenAI 承认无法读取 Astra 的全部推理,也承认隐性藏拙可能难以发现

OpenAI 宣称其新模型 Astra 是“全球最智能、对齐程度最高的模型”。但 Celia Ford 的分析指出,OpenAI 无法查看 Astra 的全部内部推理过程。该公司还承认,如果模型在评测中故意隐藏能力、压低表现,这种隐性“藏拙”很可能不会被发现。这些表态凸显了当前评估和验证先进 AI 模型行为及对齐状态的方法仍存在局限。

人工智能正在侵蚀科技行业职业阶梯的第一层

美国信息行业8月减少约2.3万个工作岗位,这可能是人工智能正在重塑劳动力市场的又一信号。东北大学教授艾丽西亚·莫德斯蒂诺表示,科技行业可能是更广泛变化的“煤矿中的金丝雀”。她的研究显示,自ChatGPT发布以来,相比高级软件开发岗位,初级软件开发岗位的招聘需求有所下降。雇主也越来越要求入门级员工具备更多经验、判断力和以人为本的技能。

DRACO:利用动态评分标准实现长程智能体训练中的细粒度信用分配

DRACO是一种用于训练长程任务AI智能体的强化学习方法,适用于缺乏可直接验证成功信号的场景。该方法在训练过程中动态生成多标准评分表,在完整轨迹结束后进行评估,再将评估结果重新分配给对相关标注标准负责的各个步骤。这样,DRACO能够为GRPO生成具有差异性的逐步优势值,而无需额外训练归因模块。在AppWorld上,DRACO比基础模型高15.9分,比使用稀疏真实奖励训练的GRPO高5.3分。在域外

选择、压缩、再投资:长视频多模态大语言模型视觉令牌分配的受控研究

一项研究评估多模态大语言模型处理一小时视频时如何分配视觉令牌。在受控条件下,帧选择是影响最大的因素:在 LongVideoBench 的一小时片段中,按查询选择的 8 帧比均匀采样的 16 帧高出 6.9 分。数十年前提出的稀疏近似算法正交匹配追踪(Orthogonal Matching Pursuit),在三个基准测试中与专门设计的选择器表现相当,或仅低不到 1 分。保持时间戳不变,将每帧的空间