AI 新闻中心

AI 新闻中心 过去一年分析了 7928 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

赛昉科技正式推出服务器级 RISC-V HPC CPU IP“昉·天枢-100”

赛昉科技(StarFive)正式推出面向高性能计算的服务器级 RISC-V CPU 内核 IP“昉·天枢-100”(Dubhe-100)。希奥端计算(LECARC)已选用该 IP,作为智能边缘服务器 CPU 的基础。赛昉称,该内核面向 AI 智能体等新兴应用不断增长的算力需求,也是中国较早达到可交付状态的服务器级 RISC-V CPU IP 之一。其性能对标 Arm Cortex-A78,宣称整数

并非被准入,而是被聚集:注意力如何让潜变量变得可语言表达

一项针对开放权重语言模型的研究,探讨潜在信息如何转化为模型能够报告的形式。研究人员使用雅可比透镜,在共享相同上下文的基准任务上进行测试,未发现预测中的独立“闸门”机制。相反,注意力机制会在模型中等深度的区域聚集信息,使变量能够在查询位置被读取。这种效果取决于任务需求,并在两种不同架构中出现在相近的相对深度。研究定位了变量变得可读的位置,但没有揭示信息传输的完整路径。研究还指出,探针测得的可见性并不

先前的审计与修复上下文使LLM验证器的判定阈值趋于宽松

一项研究分析了在自动检查流程中由一个语言模型充当验证器、另一个或同一个模型负责修复时,先前的上下文是否会改变检查结果。在字节完全一致的任务中,预先加入一次审计与修复过程后,所有15种模型与措辞组合的误报率都下降了2.8至11.5个百分点。对于其中一个模型,审计曾报告错误的过程会进一步减少误报。信号检测分析表明,变化来自判定阈值移动,而不是辨别能力下降。人工检查50个误报后发现,82%确实是错误警报

Google AI权力重组内幕:布林介入,DeepMind迎来领导层洗牌

路透社报道,Google人工智能部门过去几个月经历了剧烈的内部动荡。联合创始人谢尔盖·布林据称介入Gemini模型训练,推动加快开发并尝试递归式自我改进。下一代Gemini旗舰模型据报因在编程等关键领域落后竞争对手而推迟两个月发布。8月5日,Google DeepMind宣布由科雷·卡武库丘奥格鲁接替德米斯·哈萨比斯担任负责人;哈萨比斯转任主席,运营职责减少。在布林支持下,卡武库丘奥格鲁预计将获得

HarnessEval-W:用智能体评估视觉世界

HarnessEval-W 是一套面向世界模型的智能体评估流程。它不再只输出单一分数,而是将每个评估问题拆解为可测量的子问题,并为各个子问题配置具有专属上下文和诊断工具的专业子智能体。上级智能体会验证收集到的证据并生成最终结论,从而形成透明的证据树。该方法在 18 个代表性世界模型的 330 个评估案例上进行了测试,判断结果与人类偏好高度一致,同时能够细致诊断物理规律、因果关系和世界状态演变方面的

雷鸟宣布全新 iO 系列,首款产品定位为“人类增强 AI 眼镜”

AR 品牌雷鸟创新(RayNeo)将于 8 月 21 日 14:30 正式发布 iO 系列首款 AI 眼镜。官方将其定位为“人类增强 AI 眼镜”,重点围绕知识、表达和记忆等场景提供辅助。产品采用接近传统眼镜的设计,配备纤细钛金属镜腿,并使用显示区域近乎隐形的自研光波导显示技术,主打长期佩戴体验。具体配置、功能和售价尚未公布,目前已开启预约。

Meta 专利探索可识别人脸并自动生成精彩片段的 AI 眼镜

Meta 申请了一项智能眼镜专利,设想利用人脸识别技术识别视频中的人物,判断他们正在做什么以及与佩戴者的关系,并自动生成带人物标签的精彩片段。专利提出的应用场景包括在晚宴或聚会上录制视频后,让 AI 查找活动中的精彩内容。类似技术也可能用于企业或安防摄像系统。不过,目前这仍只是专利构想,并非已经确认的产品功能。由于涉及人脸识别、录制透明度和个人隐私,该设计可能进一步引发争议;Meta 眼镜近期已在

企业微信5.0.10接入AI Agent,全面开放十大办公能力

企业微信5.0.10于8月18日正式上线,进一步升级AI能力。根据官方信息,新版本全面开放CLI和MCP,WorkBuddy、Codex以及企业自建Agent等均可通过“智能机器人”直接接入企业微信。此次开放不设企业规模限制,一次性提供消息、文档、表格、邮件、会议等十大办公能力。Agent不仅可以从企业微信获取信息,还能通过开放接口执行办公任务。该更新进一步打通AI Agent与企业日常工作流程,

中国科学家研发猪只进食时接种疫苗的机器人

北京市农林科学院科研团队研发出一款生猪自主免疫注射机器人。系统由激光雷达导航移动底盘、六轴协作机械臂、深度视觉相机和无针注射模块组成。AI视觉算法能够识别猪只姿态,并选择猪只专心进食、较少挣扎时进行接种。机器人会定位猪尾根部附近的臀部肌肉注射点,随后通过高压无针方式完成注射。实测注射成功率达到93.3%,每头猪平均只需数秒。设备可连续运行约8小时,支持自主避障和路线规划,并能记录每头猪的免疫信息,

VideoGAIA:评估通用AI助手代理式视频理解能力的基准

VideoGAIA是一项用于评估多模态大语言模型代理式视频理解能力的新基准。不同于传统的单轮视频问答,它要求模型进行多轮交互、调用外部工具、收集补充信息,并整合多模态证据。该基准包含271项覆盖复杂真实场景的任务,每项任务均由三名人类专家独立验证。虽然领先模型在现有视频基准上的准确率已接近90%,但所有参与VideoGAIA评测的模型准确率都低于60%。这项基准旨在推动对新一代AI助手进行更严格的

PACE-Bench 评估动态环境中的代码演化物理适应能力

PACE-Bench 是一个基于模拟器的基准测试,用于评估自我进化 AI 智能体能否在物理环境变化后调整代码驱动的设计。该基准涵盖六个物理领域,共包含 144 组源环境到目标环境的适应任务。一个在源环境中有效的设计会在经过变异的目标环境中失效,智能体必须在有限尝试次数内利用诊断沙盒反馈完成修改。对十种方法的比较显示,该基准仍远未饱和。Reflexion 搭配 Qwen3-14B 仅解决了全部任务的

ConceptFormer:面向视觉文档检索中查询—文档对齐的自适应潜在概念学习

ConceptFormer 是一个用于视觉文档检索的研究框架,也是多模态检索增强生成的重要组成部分。该方法将与查询相关的证据表示为由查询条件化的连续潜在概念,在不依赖文本中间表示或直接视觉标注的情况下,连接局部视觉证据与语义相关性。训练过程中,强大的视觉语言模型会动态确定潜在概念标记的数量,并利用这些概念指导嵌入空间学习。在多个视觉文档检索基准测试中,ConceptFormer 的平均 NDCG@

UI-Mate通过上下文示范推进开放权重基础GUI智能体

UI-Mate是一款用于自动化复杂数字任务的基础GUI智能体,将基于环境的训练体系与多模态示范的上下文学习相结合。该体系可在大规模并行环境中自动完成任务生成、环境构建、执行、筛选、监督微调和在线强化学习。研究团队还推出了OSWorkerBench,涵盖41个应用中的100项长流程办公任务,并区分了针对相同目标的自我示范和针对相关任务的人类变体示范。UI-Mate-27B在OSWorld-Verif

Ventor-QTest:威胁模型驱动的托管式 LLM API 验证

该研究提出 Ventor-QTest,一种用于审计第三方提供商托管开放权重语言模型所使用推理 API 的黑盒方法。它不需要目标 API 提供概率信息,而是通过重复请求和长序列测试,利用平均保真度损失(AFL)与极端保真度损失(EFL)衡量输出的不稳定性。在多种路由条件下,AFL与基于 logprob 的比较指标表现出较强的描述性一致性。EFL显著升高时,随着任务暴露增加,Terminal-Benc