AI 新闻中心

AI 新闻中心 过去30天分析了 2394 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

谷歌 Googlebook 的 Look up 应用提前曝光,主打上下文搜索和航班追踪

谷歌面向即将推出的 Googlebook 平台开发的 Look up 应用曾短暂上架 Google Play,随后被官方下架。该应用定位为桌面端上下文工具,用户选中文字后,无需离开当前页面,即可通过浮动窗口查看相关信息。已展示的信息来源包括 Google 搜索、Google 地图和 Google 航班,支持词义解释、地点信息和航班动态查询。用户还可以在类似聊天机器人的输入框中继续提问,将单次查询扩

Anthropic 升级 Claude Code 与 Cowork,支持后台操控 Mac

Anthropic 扩展了 macOS 版 Claude Cowork 和 Claude Code 的电脑控制功能。用户处理其他工作时,Claude 现在可以在后台通过屏幕交互执行点击、输入文字和导航操作。该功能要求使用 macOS 15 或更高版本,Mac 保持唤醒状态,并保持 Claude Desktop 应用打开。用户还可以在设置中启用“完全控制”模式。目前该功能仅面向个人 Pro 和 Ma

Kirin:从真实环境视频生成动物运动

Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和

HarnessDev:大语言模型能否创建并进化自己的智能体框架?

HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部

Repo-To-Skill:将 GitHub 仓库提炼为 AI 技能

该研究推出 DisCo,一种将 GitHub 仓库和论文中的实践知识转化为紧凑、经过验证的技能的研究代理,用于自主机器学习研究。其 AREX-Skill Library 从 1,000 个广泛使用的 ML 仓库中提炼出超过 5,000 项技能。在模型、研究框架和执行预算保持不变的情况下,研究称配备这些技能的代理在 MLE-bench、PaperBench、FrontierCS 和 PassNet

地平线征程智驾芯片量产突破1500万套

中国芯片企业地平线宣布,征程系列智能驾驶芯片量产规模已突破1500万套。据公司介绍,相关芯片累计赋能800万名车主,并与超过40个汽车品牌达成合作,中国前十大车企均在其中。自2020年启动前装量产以来,地平线用了5年实现从0到1000万套,而从1000万套增至1500万套仅用12个月。公司称,目前已有500款量产车型确定采用其芯片,其中近130款属于中高阶智能驾驶领域,在手定点总量超过2000万套

EarlyEval通过提前预测结果降低AI智能体评估成本

评估大语言模型智能体的成本可能很高:前沿模型运行一次基准测试就可能花费数百至数千美元,反复测试会进一步增加开发成本。EarlyEval通过分析智能体的中间行为,提前预测其最终结果,并在成功或失败的置信度达到设定阈值时停止运行。该轻量级框架使用两个基于行为、文本和参考解决方案特征训练的LightGBM分类器。在SWE-bench Verified、TerminalBench和Toolathlon上,

PS3 模拟器 RPCS3 因性能影响拒绝跟进英伟达 DLSS 5

RPCS3 团队表示,不会将英伟达 DLSS 5 集成到 PS3 模拟器的官方版本中。部分用户据称已在 RPCS3 渲染器中测试泄露的 DLSS 5 DLL 文件,团队称测试结果显示性能下降。据相关报道,英伟达表示,目前启用 DLSS 5 可能导致游戏性能下降 50% 至 60%。DLSS 5 被描述为面向 RTX 50 系列显卡的新一代超分辨率和神经渲染技术。上述信息基于泄露文件测试及文章引用的

后训练让语言模型在编程竞赛中达到金牌水平

一项研究提出了一套端到端流程,用于将大型语言模型专门训练成竞赛编程系统。该方法结合了精选题目、合成推理轨迹、监督微调和强化学习。使用22,000道题目训练的Nemotron-3-Nano-CC,在加入测试时生成、评估和改进解答的策略后,于IOI 2025获得468分,超过金牌门槛。更大的Ultra-CC模型获得502分。随后,一个针对竞赛专门调整的系统在IOI 2026的前瞻性评估中取得600分中

ExecRetrieval 衡量代码嵌入检索中的功能正确性差距

ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在

PaperCompiler:通过仓库级规范编译实现忠实的论文到代码生成

PaperCompiler 是一个将研究论文转换为仓库级实现的框架。它把与实现相关的证据编译为明确的规范,保留来源信息,并区分论文支持、推断、外部委托和未解决的内容。规范还编码了防止性能退化的要求、任务归属、跨文件依赖关系和文件级约束。在 Paper2CodeBench 上,PaperCompiler 相比强基线将基于参考实现的保真度相对提升了 13.8%,得分从 3.64 提高到 4.15,同时

AI让“赛博蟑螂”自主识别并躲避危险,准确率最高达93%

研究人员正在开发将AI、传感器和通信设备安装在蟑螂身上的系统,用于灾害现场搜救。背包式设备可以测量蟑螂的心跳、神经信号和身体动作,再由AI分析数据、判断周围环境,并辅助引导蟑螂避开危险区域。在紫外线、化学物质暴露和高温等环境测试中,表现最佳的模型达到93%的识别准确率,研究人员还成功引导蟑螂逃出迷宫。相关技术已进入灾区测试,但进入钢筋混凝土建筑后容易出现通信不稳定。其他研究则关注为昆虫提供水下活动