WeVisDoc:从覆盖范围到能力,提升稳健的端到端文档解析
WeVisDoc 是一个面向稳健端到端文档解析的两阶段数据驱动框架。第一阶段通过异构数据和保持结构的退化合成,扩大语义、结构与外观覆盖范围。第二阶段在固定的视觉—结构聚类中测量解析器的剩余错误,并据此指导针对性数据构建和目标标记令牌预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 分,在 PureDocBench 的三个测试轨道上平均取得 75.5
AI 新闻中心 过去30天分析了 4605 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
WeVisDoc 是一个面向稳健端到端文档解析的两阶段数据驱动框架。第一阶段通过异构数据和保持结构的退化合成,扩大语义、结构与外观覆盖范围。第二阶段在固定的视觉—结构聚类中测量解析器的剩余错误,并据此指导针对性数据构建和目标标记令牌预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 分,在 PureDocBench 的三个测试轨道上平均取得 75.5
安克与飞书联合打造的 AI 会议耳机已在中国开启预售,售价 1799 元,首发补贴后最低 1376.23 元。耳机搭载安克 Thus AI 音频芯片、8 颗 MEMS 麦克风和 2 颗骨传导 VPU 麦克风。安克称,Adaptive ANC 4.0 系统结合神经网络算法后,降噪性能较上一代提升 2 倍。产品深度整合飞书 AI 与飞书妙记,支持耳机和充电盒双端录音、多语种混合识别、实时翻译及说话人区
Snap 已正式推出首款面向普通消费者的独立式 AR 眼镜 Snap Specs。Wi-Fi 版本售价 2195 美元,与 Verizon 合作推出的蜂窝网络版本售价 2395 美元,另需支付每月数据套餐费用。眼镜重量为 132 克或 136 克,支持近视镜片插片,并采用 LCoS 显示技术,提供 51 度视场角和 1600 万色显示。电致变色镜片可在 10 秒内从透明状态切换至墨镜模式。设备无需
华为计划于2026年9月30日在中国市场、11月30日在全球市场商用灵衢昇腾950智算集群云服务。华为表示,昇腾950超节点已开始规模商用。由1024张卡组成的集群据称可提供最高1 EFLOPS的FP8和2 EFLOPS的FP4算力,并配备256TB全局统一内存编址空间,可支持超大型语言模型的全流程训练。华为还宣布昇腾960不同版本将提前发布,后续产品规划延伸至2029年,并表示新一代近封装光学产
加速进化已在中国推出人形机器人 Booster K1 探索版,京东售价为 38999 元。该机器人身高约 95 厘米、重量约 19.5 千克,拥有 22 个自由度,配备双目深度相机、3 麦克风和扬声器。内置豆包大模型,可支持语音对话和语义理解。面向开发者,产品提供 48 TOPS 算力、开放 API 以及 OTA 更新能力,可用于定制和二次开发。该产品定位为具身智能开发的入门级整机,价格低于许多传
Figure于9月17日发布人形机器人神经网络Helix 2.5。该模型基于公司的人类行为数据集Index预训练,并在旧金山湾区30个此前未采集数据的家庭中测试。在整理客厅、折叠毛巾和铺床三类任务中,Helix 2.5的零样本成功率达到56%,而从零开始训练的同条件策略为9%。测试使用了训练数据未涵盖的家庭环境和物品,且只有完整完成任务才计为成功。Figure表示,Helix 2.5仅使用Heli
工业和信息化部、国家发展改革委等十部门发布“十五五”医药工业发展规划,提出加快人工智能、量子计算、超级计算和计算医学等新技术在药物研发中的应用。规划支持医药企业、高校、科研院所和医疗机构开展联合攻关,并将基因编辑、分子精准递送、细胞编程、先进组学、生物制造等列为重点方向。该文件主要提出产业政策目标和技术布局,并未公布具体的人工智能研发成果或已验证的重大突破。
Anthropic 推出了面向生命科学领域的认证计划。根据计划,Mythos 5.1、Opus 5 和 Sonnet 5 三款模型均适用标准化的使用与授权条款。该举措通过合同明确了药企、生物技术公司和科研机构将这些模型用于研发、文献梳理或实验辅助时的使用范围与责任。对于监管要求较高的生命科学行业,统一条款可帮助相关机构评估模型是否适合进入研究和实验流程。
据《纽约时报》起诉OpenAI和微软的版权案中解封的法院文件,两家公司高管曾私下承认,其AI产品可能替代新闻文章,并对新闻业构成威胁。诉讼指控两家公司未经许可使用数百万篇《纽约时报》文章训练AI模型。OpenAI公开辩称,使用公开可获得的材料训练模型通常属于合理使用;出版商则要求AI公司取得授权、让其参与控制内容的使用方式,并获得持续且公平的补偿。美国其他报纸也相继提起诉讼,围绕受版权保护的新闻内
EvoSkill-GUI 是一个无需额外训练的框架,使 GUI 智能体能够根据执行反馈在部署阶段修订可复用技能。每项技能都以结构化软件包形式管理,包含检索元数据、可执行计划、备用定位方法、失败恢复规则、无障碍工具和失败案例。在“反思—修订—复用”循环中,智能体会诊断失败的执行轨迹,并有针对性地更新技能文件。在 MobileWorld、AndroidWorld 和 OSWorld 三个基准测试中,该
Vision-RL2 在避免大幅增加视觉 token 成本的同时,提升多模态大语言模型(MLLM)的细粒度视觉感知能力。该方法先从压缩视图中定位相关区域,再将更高分辨率集中到选定证据上。研究人员通过区域级强化学习优化轻量级候选区域网络,并使用冻结的 MLLM 读取器评估各区域对答案的贡献。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在所有视觉 token 预算下都提升了准确
Video DeltaNet 将局部 Softmax 注意力与双向线性记忆结合起来,以降低视频扩散模型处理长时空令牌序列的成本。其 Video Delta Attention 机制在联合处理空间令牌的同时,每帧更新一次记忆;分阶段的教师模型对齐流程则将这一新路径引入预训练模型。在 MiniMax H3 实现中,该混合方法用于视频到视频的交互,而涉及文本或音频的交互仍保留 Softmax 注意力。结
UFO 是一个统一框架,用于评估多模态图像生成系统是否能同时满足文本和视觉条件。该方法将整体对齐目标拆分为细粒度、相互解耦的原子评估单元,并通过通用或专用功能调用逐一验证。实验表明,在参与评测的方法中,UFO 与人工偏好的相关性最高,平均相关性提升了 15.25%。研究人员还提出 UFO-Bench,用于在文本与视觉条件的多种交互场景下全面评估图像定制模型。
一项研究分析了解答或完整推理过程等参考信息,能为语言模型的策略内自蒸馏带来多少额外价值。研究人员构建了 AMPLE-Math 数据集,包含 5,319 道数学题,每道题提供六种共享同一答案的推理视图,并将使用参考信息的蒸馏与条件匹配的无参考蒸馏进行比较。结果显示,在启用思考能力的评估中,Qwen3-1.7B 的大部分性能提升都可以由无参考蒸馏解释。参考信息带来的额外收益在 Qwen 上较为有限,在
大型推理模型在复杂任务上表现出色,但常在简单问题上浪费计算资源,在困难问题上又推理不足。When2Think是一种后训练框架,可根据每个问题的难度动态分配推理深度。该方法结合实例级难度感知奖励塑形、基于验证器的奖励以及批次标准化优势,无需训练奖励模型,也无需在线查询参考模型。在数学基准测试中,相比基础模型,AIME24上的Pass@3提升10.0%,Token使用量减少27.9%。在AIME25上