PyroAdapt:适应空间异质性与时间分布变化的野火预测方法
PyroAdapt是一种“预训练—检索—排序”框架,用于让预训练模型适应野火预测中的目标条件变化。该方法检索具有相似条件的历史地点,并通过风险排序对模型进行微调。在加州666个网格单元上的实验中,日均平均精确率从21.62%提升至最高24.57%,前5%高风险区域的召回率则从18.70%提升至最高22.79%。在每天固定检测34个网格单元的预算下,该方法额外识别出344个阳性网格日。约塞米蒂地区的
AI 新闻中心 过去7天分析了 1091 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
PyroAdapt是一种“预训练—检索—排序”框架,用于让预训练模型适应野火预测中的目标条件变化。该方法检索具有相似条件的历史地点,并通过风险排序对模型进行微调。在加州666个网格单元上的实验中,日均平均精确率从21.62%提升至最高24.57%,前5%高风险区域的召回率则从18.70%提升至最高22.79%。在每天固定检测34个网格单元的预算下,该方法额外识别出344个阳性网格日。约塞米蒂地区的
微软首席执行官萨蒂亚·纳德拉在采访中表示,AI行业过于关注技术和前沿概念,忽视了用户的实际需求。人们想知道AI能否带来切实利益、能否由自己掌控,以及能否从中获得经济收益。他认为,行业要赢得消费者和社区的信任,就必须重视现实价值,而不是为了技术本身而庆祝技术。
Patrick O’Shaughnessy 采访 Instinct 创始人 Noah Shinn,讨论这家 AI 公司的商业模式、隐私、安全与安保、计算资源保障,以及与大型科技公司的竞争。访谈还分析了 Instinct 的战略定位和塑造 AI 行业的整体商业环境。
金融数据供应商MSCI推出了一系列覆盖人工智能价值链的指数。该公司表示,这些指数旨在帮助投资者更精准地对冲其在AI领域的风险敞口。
Rolling-WAM是一种面向机器人操作的方法,将动作生成与未来视觉预测相结合。传统方法在每次重新规划时,都需要从头对整个视频—动作预测范围进行完整去噪;该方法则把计算分摊到连续的重新规划周期中。滑动窗口会保留处于不同噪声水平的视频—动作片段:即将执行的片段被完全去噪,较远的未来片段则持续进行部分精炼。在LIBERO、RoboTwin以及真实的Unitree G1人形机器人上的评估表明,该方法具
RoboFoundry是一种通过经过验证的整体系统更新来改进具身智能体的框架,而非单独优化各个组件。它分析执行经验,更新上下文与记忆系统以及层级技能,并将改进迁移到不同机器人上。作者称,该方法在EmbodiedBench上达到领先水平,较GPT-5.5提升27.8%。在RoboMemArena的长时记忆评测中,它至少领先基线方法39%;在LIBERO-PRO上,根据扰动类型,其表现比Cap-Age
该研究提出“Physical Coding”,将机器人任务的状态和流程表示为代码,使智能体能够依据反馈规划、验证并修正行动。HexaAnything整合了感知、规划和控制工具,包括VLA和WAM策略。在RoboCasa365上,它在未见过的复合任务和总体成功率方面超过XR-1 VLA;利用执行轨迹训练的HexaModel也在所有数据划分上优于基础模型。该智能体还在模拟环境和双臂机器人上自主完成了物
Arena 对 Text Arena 高推理回答的分析显示,与 Claude Opus 5 相比,Claude Opus 5.5 明显减少了破折号和分号的使用。破折号从每 1,000 个单词 15.2 个降至 0.8 个,分号从 6.10 个降至 1.64 个。平均句长也从 12.14 个单词缩短至 10.03 个。与此同时,平均回答长度从 453 个单词增加至 481 个。Arena 表示,分析
Fireworks AI 发布了 FireRouter with Opus,这是一款针对 Claude Opus 模型优化的缓存感知路由器,并首次以独立无服务器端点形式提供。根据持续一个多月的内部 A/B 测试,在编码任务中,该系统达到单独使用 Opus 时 98.1% 的准确率,同时将每次会话成本从 15.36 美元降至 6.63 美元。路由器会评估每个模型的任务适配度、预计成本以及提示缓存影响
运动相机厂商影石(Insta360)据称正在研发一款主打拍摄体验的智能眼镜。其设计将电池与眼镜主体分离,由用户随身携带供电,主要功能模块则集成在镜腿中,以减轻头部负担并支持长时间拍摄。前镜框支持更换,使产品更像日常配饰。AI方面,影石可能先接入阿里巴巴的通义千问大模型,长期则计划开发自有生成式AI能力。影石在防抖算法和影像技术方面具备一定优势,但仍需面对供应链、销售渠道以及缺乏刚需应用场景等问题。
在需要执行长串相互依赖操作的任务中,AI智能体可能逐渐偏离最初目标。一项研究提出自适应一致性图(ACG),持续整理执行证据及其来源,并在有限的上下文预算内,为每次决策构建以任务要求为中心的信息视图。ACG不会取代基础智能体的规划器或工具执行器。在对照评估中,GPT-5.6-luna使用ReAct时的平均成功率为44.5%,使用ACG后升至50.2%。在BrowseComp-Plus上,成功率从62
CoWA 是一种注意力架构,将因果上下文的访问分配给多个 KV 头,而不是让每个头重复处理。每个头只关注部分远距离 token,但所有头合起来仍能覆盖完整上下文。在 128K token 基准测试中,与 FullAttn 相比,CoWA 将训练前向和反向传播延迟分别降低 7.4 倍和 8.6 倍,并将推理解码延迟降低 3 倍。报告中的扩展实验显示,CoWA 在减少总训练计算量的同时,模型质量与 F
研究人员推出 MALA,这是一种融合式注意力算子,可根据归一化后的注意力贡献分配分数计算之后的计算量。在 128K token 基准测试中,与 FullAttn 相比,MALA 将训练前向和反向计算的延迟分别降低至原来的 1/2.2 和 1/3.0,推理解码延迟则降低至 1/1.6。在 0.6B 至 14B 参数模型的测试中,其困惑度与 FullAttn 接近,在知识、推理和长上下文检索评测中的表
论文提出 AlignOPSD,这是一种面向长序列决策智能体的 On-Policy 自蒸馏方法。研究指出,基于时间戳的监督信号可能与学生模型的对应决策不匹配,而一次决策也可能跨越多个时间步。AlignOPSD 将监督信号对齐到功能相符的决策情境,并在持续时间不同的决策区间内分配信用。使用 Qwen2.5-3B 和 Qwen2.5-7B 在 ALFWorld、WebShop 和 Search-QA 上
SpatialSpeak是一种用于提升视觉语言模型空间推理能力的两阶段框架。第一阶段通过问答任务,让模型从多视角输入中学习重建细粒度局部三维几何和全局场景上下文。第二阶段引入空间链式思维训练,并结合可靠性评估与视觉补偿来修正答案。在ReVSI上,重建预训练使CoT方法的提升幅度从2.6分增加到6.9分。作者报告称,该方法在ReVSI、VSI-Bench和SPAR-Bench上取得当时最佳结果;其R