AI让“赛博蟑螂”自主识别并躲避危险,准确率最高达93%
研究人员正在开发将AI、传感器和通信设备安装在蟑螂身上的系统,用于灾害现场搜救。背包式设备可以测量蟑螂的心跳、神经信号和身体动作,再由AI分析数据、判断周围环境,并辅助引导蟑螂避开危险区域。在紫外线、化学物质暴露和高温等环境测试中,表现最佳的模型达到93%的识别准确率,研究人员还成功引导蟑螂逃出迷宫。相关技术已进入灾区测试,但进入钢筋混凝土建筑后容易出现通信不稳定。其他研究则关注为昆虫提供水下活动
AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
研究人员正在开发将AI、传感器和通信设备安装在蟑螂身上的系统,用于灾害现场搜救。背包式设备可以测量蟑螂的心跳、神经信号和身体动作,再由AI分析数据、判断周围环境,并辅助引导蟑螂避开危险区域。在紫外线、化学物质暴露和高温等环境测试中,表现最佳的模型达到93%的识别准确率,研究人员还成功引导蟑螂逃出迷宫。相关技术已进入灾区测试,但进入钢筋混凝土建筑后容易出现通信不稳定。其他研究则关注为昆虫提供水下活动
这项研究提出了 CoGR,一种让语言模型同时为查询和检索项生成紧凑关键词表示的检索框架。这些表示通过倒排索引直接匹配,因此能够兼容现有的关键词检索基础设施。在监督式微调之后,协同进化强化学习交替优化查询侧和项目侧生成器。与10种稀疏、稠密和生成式检索基线相比,CoGR在内部应用市场数据集和公开WANDS基准上均取得最佳表现,F1值较最强基线分别提升10.9%和36.1%。
该研究分析了 SWE-bench 基准任务与编程智能体实际收到的用户请求之间的差距。真实提示词中有 88% 仅包含问题描述或有限的额外上下文,而基准任务中符合这一结构的比例只有 7%。此外,87% 的真实请求使用较为口语化的表达,94% 的基准问题则采用正式文体。研究人员推出 RealSWE,包含 381 个任务族,并对信息组成和语言风格进行受控变化。在七个当代大语言模型上的测试显示,更贴近现实的
由美国新泽西理工学院牵头的研究团队开发了机器学习模型 EarlyDetect,用于预测太阳活动区的形成。该模型采用 Transformer 架构,分析 NASA 太阳动力学观测台获取的太阳声学活动和磁场数据。性能最佳的版本平均可在活动区变得可见前9.24小时识别出相关前兆信号。这项技术有望补充空间天气预报,为卫星通信企业和电网运营商争取更多时间,以应对太阳风暴风险。不过,EarlyDetect 目
一项研究指出,长期运行的LLM智能体如果通过持久化记忆错误记录权限、限制或撤销信息,即使没有外部攻击,也可能执行原本未获授权的操作。研究人员将这一问题称为“内生性授权洗白”,并推出EAL-Bench,用于评估记忆系统保存动态授权状态的准确性,以及错误是否会导致后续越权行为。研究覆盖采购、网络安全和金融场景,测试了5个负责写入记忆的LLM和2个负责执行任务的LLM。在渐进式记忆更新下,写入模型最多会
本期科技资讯包含多项 AI 动态。谷歌上线 Gemini 3.8 Flash,面向软件工程、智能体任务和复杂知识处理流程,主打以较低成本进行大规模生产部署。李飞飞创办的 World Labs 发布 Atlas,称其为多模态世界模型,可实现高精度镜头控制、图像和视频生成,以及 3D 重建。腾讯推出 WorkBuddy 开放平台,支持开发者创建和管理智能体技能与专家能力。努比亚表示第二代豆包手机计划于
一项研究在接触密集的机器人 ParcelStow 任务中,以不同执行速度比较脚本专家与利用专家示范训练的 Action Chunking with Transformers(ACT)策略。两者在标称速度下的任务成功率均为 100%。但在测试的最高速度下,专家成功率降至 84%,ACT 仅为 53%。两个 ACT 策略相比标称速度分别下降 34 和 48 个百分点,而专家下降 16 个百分点。ACT
一项研究发现,基于logit的知识蒸馏在不同训练阶段会产生不同效果。在预训练阶段,它能同时提升推理能力和事实记忆;但在中间训练阶段,虽然推理能力继续增强,事实知识的获取却会放缓。研究人员将这一现象归因于教师模型在不同数据领域中的置信度差异,以及学生模型不断变化的知识状态。研究提出了Switch Distillation:利用教师模型的预测熵,仅在教师高度确信的词元上进行蒸馏,否则使用交叉熵训练。与
据称,OpenAI的新模型Astra将采用“递归深度”技术,使模型能够超越大多数推理模型所采用的顺序思考方式运行。这一方法引发了人工智能安全专家的担忧。
麻省理工学院相关人士与MIT-IBM Computing Research Lab展开合作,旨在将严谨的理论研究转化为生产系统。公告没有说明具体技术成果或部署规模。
初创公司 Mostik 正在探索一种不同寻常的方法,以结合多个 AI 模型的能力。该方法旨在让模型无需使用自然语言即可交换信息。
研究提出了一种名为“代理式数据破解”的方法,旨在降低大型语言模型代理处理网页、报告、合同、监管文件和 PDF 时的成本。代理读取文档并进行推理时,子代理会提取有用的结构化信息,并预先整理可能服务于未来相关查询的内容。之后的问题可以直接利用积累的结构化数据回答,无需再次打开原始文档。在 FanOutQA 基准测试中,每个测试问题增加一个相关问题后,该方法在保持准确率的同时将成本降低了 53%。
文章调查了 AI 生成图片和文字为何难以被可靠识别。明显的“AI生成”标识很容易被去除,C2PA 来源元数据也可能在截图、裁剪或压缩后消失。谷歌的 SynthID 隐形水印更耐修改,但不同公司的检测器并不互通,也可能遭到去除和对抗攻击。作者测试多种文本与图片检测工具后发现,知名模型的生成内容有时能够被识别,较冷门模型则经常逃过检测,结果差异明显。文章认为,目前不存在完美的通用检测器。未来与其只关注
该研究提出 CASTER,一种用于冻结模型测试时适应的无梯度方法。CASTER 将源类别统计量存储在判别子空间中,根据目标批次的矩估计类别共享的仿射变换,并在分类前以解析方式传输源分布。该方法无需反向传播、优化器状态或存储特征库。在 4 种骨干网络和 7 个数据集上,CASTER 使用相同的冻结特征,在 28 个设置中的 27 个超过 k-NN,同时所需状态量的中位数减少 18 倍。不过,仿射传输
DramaChain Bench 首次覆盖了 AI 短剧制作的完整流程,包括剧本、分镜、关键帧图像、镜头级视频和成品剧集。该基准采用 5 个评估维度,进一步细分为 63 个叶级指标。5,785 个项目由 3 名专业标注员独立评分,形成 17,488 个有效分数和 255,925 条可追溯的缺陷归因记录。人工标注表明,上游环节产生的缺陷会在后续流程中级联,最终剧集质量并不只取决于视频生成。基于智能体