中国科学家研发猪只进食时接种疫苗的机器人
北京市农林科学院科研团队研发出一款生猪自主免疫注射机器人。系统由激光雷达导航移动底盘、六轴协作机械臂、深度视觉相机和无针注射模块组成。AI视觉算法能够识别猪只姿态,并选择猪只专心进食、较少挣扎时进行接种。机器人会定位猪尾根部附近的臀部肌肉注射点,随后通过高压无针方式完成注射。实测注射成功率达到93.3%,每头猪平均只需数秒。设备可连续运行约8小时,支持自主避障和路线规划,并能记录每头猪的免疫信息,
AI 新闻中心 过去一年分析了 1375 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
北京市农林科学院科研团队研发出一款生猪自主免疫注射机器人。系统由激光雷达导航移动底盘、六轴协作机械臂、深度视觉相机和无针注射模块组成。AI视觉算法能够识别猪只姿态,并选择猪只专心进食、较少挣扎时进行接种。机器人会定位猪尾根部附近的臀部肌肉注射点,随后通过高压无针方式完成注射。实测注射成功率达到93.3%,每头猪平均只需数秒。设备可连续运行约8小时,支持自主避障和路线规划,并能记录每头猪的免疫信息,
VideoGAIA是一项用于评估多模态大语言模型代理式视频理解能力的新基准。不同于传统的单轮视频问答,它要求模型进行多轮交互、调用外部工具、收集补充信息,并整合多模态证据。该基准包含271项覆盖复杂真实场景的任务,每项任务均由三名人类专家独立验证。虽然领先模型在现有视频基准上的准确率已接近90%,但所有参与VideoGAIA评测的模型准确率都低于60%。这项基准旨在推动对新一代AI助手进行更严格的
PACE-Bench 是一个基于模拟器的基准测试,用于评估自我进化 AI 智能体能否在物理环境变化后调整代码驱动的设计。该基准涵盖六个物理领域,共包含 144 组源环境到目标环境的适应任务。一个在源环境中有效的设计会在经过变异的目标环境中失效,智能体必须在有限尝试次数内利用诊断沙盒反馈完成修改。对十种方法的比较显示,该基准仍远未饱和。Reflexion 搭配 Qwen3-14B 仅解决了全部任务的
ConceptFormer 是一个用于视觉文档检索的研究框架,也是多模态检索增强生成的重要组成部分。该方法将与查询相关的证据表示为由查询条件化的连续潜在概念,在不依赖文本中间表示或直接视觉标注的情况下,连接局部视觉证据与语义相关性。训练过程中,强大的视觉语言模型会动态确定潜在概念标记的数量,并利用这些概念指导嵌入空间学习。在多个视觉文档检索基准测试中,ConceptFormer 的平均 NDCG@
UI-Mate是一款用于自动化复杂数字任务的基础GUI智能体,将基于环境的训练体系与多模态示范的上下文学习相结合。该体系可在大规模并行环境中自动完成任务生成、环境构建、执行、筛选、监督微调和在线强化学习。研究团队还推出了OSWorkerBench,涵盖41个应用中的100项长流程办公任务,并区分了针对相同目标的自我示范和针对相关任务的人类变体示范。UI-Mate-27B在OSWorld-Verif
该研究提出 Ventor-QTest,一种用于审计第三方提供商托管开放权重语言模型所使用推理 API 的黑盒方法。它不需要目标 API 提供概率信息,而是通过重复请求和长序列测试,利用平均保真度损失(AFL)与极端保真度损失(EFL)衡量输出的不稳定性。在多种路由条件下,AFL与基于 logprob 的比较指标表现出较强的描述性一致性。EFL显著升高时,随着任务暴露增加,Terminal-Benc
一项新研究将矩阵乘法指数ω的已知最佳上界从2.371339改进至低于2.371177。研究人员重新表述了核心优化问题,使其能够在更广泛的条件下求解,并利用近期机器学习进展设计了新的优化算法,随后通过AlphaEvolve进一步改进。该成果建立在组合损失分析之上,这是激光法的一种改进方法,用于研究矩阵乘法的计算复杂度。
本文研究大规模像素空间文本到图像扩散模型的训练方法。作者发现,直接在像素空间进行预训练的收敛速度明显慢于潜在空间训练。因此,他们提出先在潜在空间高效学习生成先验,再在后训练阶段切换到像素空间的策略。研究系统分析了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计。结果表明,该方法生成的像素空间模型能够达到或超过潜在空间模型的性能,同时将端到端推理速度提升约3.18至4.75倍。
ClawGym II 提出了一套框架,用于通过复杂且不透明的智能体框架,对通用 AI 智能体进行稳定、可扩展的强化学习优化。该系统利用沙盒隔离任务环境并支持并行执行,通过服务代理捕获模型调用,再以前缀树重建多轮轨迹,同时适配 PPO 和 GRPO。使用 Qwen3-30A3B 时,ClawGym-Bench 的 Pass@1 在 OpenClaw 和 Claude Code 上分别提升 9.98
GenRouter 是一个统一多种智能体图像生成工作流的框架,可根据提示需求将任务路由至合适的处理流程。它使用基础组件和可执行模板对不同管线进行标准化,再通过需求分析、经验匹配和帕累托筛选选择配置。根据论文报告的实验结果,与计算量较大的静态管线相比,GenRouter 在提升视觉匹配度的同时,将执行成本降低了 95% 以上,延迟降低了 65%。系统还会持续积累经验,以增强零样本泛化能力,并进一步将
R^3-Bench评估六个语言模型如何在共享预算下,将有限的计算资源分配给由六道题组成的任务集。测试涵盖数学、竞赛编程和抽象推理,并包含无工具和代理式场景。研究根据各模型处理单题时的响应曲线构建了一个经验基准。在主要结果表的72个单元中,该基准在全部单元都达到或超过竞赛平均表现,并在71个单元中更高。结果表明,模型在单题上展现出的能力,与必须在多个任务之间分配资源时实际发挥这些能力的水平之间,存在
字节跳动Seed团队与清华大学智能产业研究院(AIR)发布了CUDA Agent,这是一套通过强化学习训练大语言模型优化GPU内核的系统。该智能体运行在配备性能分析工具、正确性校验和安全沙盒的真实CUDA开发环境中。经过最多150步的PPO训练后,系统在KernelBench的250项任务中达到98.8%的通过率,生成内核中有96.8%的运行速度超过torch.compile。完整模型权重目前尚未
一项分析研究探讨了由大型语言模型驱动的智能体人工智能系统,其不断扩展的认知能力可能如何影响人类的主体性、自主性和控制能力。研究提出了一个涵盖物理认知、社会认知和自我指涉认知的三层框架,并评估每个层级的潜在风险。同时,研究提出了相应的缓解策略,以提升智能体人工智能系统的可控性和长期安全性。
VibeWorlding是一套用于评估和训练多模态智能体的框架,旨在让智能体根据用户指令创建交互式3D世界。其VWE-BENCH包含2616个3D资产、323个由人工标注的初始世界,以及6828条多模态查询。VibeWorlding-Gym通过MCP工具整合资产检索、编辑和渲染,并利用基于评分标准的验证器检查物理可行性和用户意图的满足程度。实验表明,当前多模态大语言模型仍难以稳定完成这项任务;即使
NaviDC-OCR 是一个基于视觉语言模型的统一文档解析框架。该系统通过形变感知学习处理相机拍摄文档中的几何畸变,利用自适应采样表示复杂版面,并将内容与结构分开建模,包括公式语法和表格结构。研究团队表示,NaviDC-OCR 在多项文档解析基准测试中取得领先性能,在 OmniDocBench v1.6、Wild-OmniDocBench 和 PureDocBench 上分别获得 96.87、88