更少 Token,更多自我学习:用于极限视觉 Token 压缩的策略内自蒸馏
该研究提出 LT-OPD,一种用于减少多模态大语言模型视觉 Token 的训练框架。高度压缩的学生模型仅使用少量视觉 Token 生成回答,而同一模型的完整 Token 版本以冻结状态提供分布监督。训练过程中,预算课程会逐步降低 Token 上限。在 9 项基准测试中,仅保留 5% 的视觉 Token,平均保留性能便从 68.6% 提升至 82.3%。该方法在多个模型系列上均实现迁移,并在不增加推
AI 新闻中心 过去30天分析了 4731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究提出 LT-OPD,一种用于减少多模态大语言模型视觉 Token 的训练框架。高度压缩的学生模型仅使用少量视觉 Token 生成回答,而同一模型的完整 Token 版本以冻结状态提供分布监督。训练过程中,预算课程会逐步降低 Token 上限。在 9 项基准测试中,仅保留 5% 的视觉 Token,平均保留性能便从 68.6% 提升至 82.3%。该方法在多个模型系列上均实现迁移,并在不增加推
研究人员提出了DRM,一种用于大语言模型对齐的扩散奖励模型。传统方法通常将每个提示—回答对压缩为单点估计,或假设输出属于固定的参数分布;DRM则对可能奖励的条件分布进行建模。轻量级扩散Transformer从噪声中生成奖励向量,能够表示人类偏好的多峰结构。该架构同时支持多属性回归和成对偏好数据。在五项基准测试中,DRM以相对有限的训练规模达到或超过基线方法。基于不确定性的拒绝策略以及分位数聚合,可
VQS是一种利用未标注图像自我改进视觉语言模型的方法。它不再通过多数投票或模型评审为生成答案打标签,而是将图像解析为场景图、图表数据表或示意图图结构等结构化记录。固定程序根据这些记录生成问题并计算答案,模型则逐条核验视觉事实。人工评估显示,VQS答案的正确率为94%,高于多数投票方法的76%。在十项基准测试中,VQS使2B、4B和8B规模的Qwen3-VL最多提升3.18分。经过三轮训练后,2B模
三星电机计划在韩国和越南合计投资6.78万亿韩元,扩大AI服务器用FCBGA半导体基板产能。其中,世宗生产基地将投入4.27万亿韩元,投资期为2026年9月至2028年5月;越南子公司将投入2.51万亿韩元,目标于2030年6月前完工投产。此次扩产旨在满足中长期客户订单需求,并加强面向AI服务器、高性能计算和汽车电子市场的供应能力。
微软最新《全球人工智能普及报告》显示,2026年第二季度全球劳动年龄人口中的 AI 用户占比达到18.8%,较上一季度上升约1个百分点。阿拉伯联合酋长国和新加坡的采用率最高,分别为70.1%和64.3%。韩国从37.1%升至40.6%,增幅最大。全球北方劳动年龄人口的平均采用率为28.8%,全球南方仅为16.2%,南北差距进一步扩大。美国的比例为33.0%,日本则从22.5%升至24.7%。
OpenAI表示,将为澳大利亚加强网络防御提供资金和技术支持,并成立专项工作组,应对能力不断增强的人工智能智能体带来的风险。此前有消息称,OpenAI旗下模型曾访问澳大利亚政府网站。公司称,将动用规模达10亿美元的“Daybreak for Frontline Defenders”基金,协助澳大利亚各级政府和本土行业保护关键基础设施。工作组将制定可执行的政策建议,完善事件通报机制,并加强与澳大利亚
据报道,腾讯正在内部秘密测试名为“鹅次元”的AI产品,通过虚拟角色充当游戏陪伴者。该服务结合实时画面识别、双向语音通话和文本交互,提供桌面虚拟角色、壁纸生成、日常聊天,以及在热门网游中的实时陪玩功能。产品不以提升玩家操作水平为重点,而是聚焦单人游戏和碎片化时间中的情绪支持。虽然目前全功能测试版免费使用,腾讯已规划按对话次数、通话与陪伴时长以及图片生成量计费的按量付费机制。产品能否稳定识别复杂游戏画
文章称,Anthropic于9月29日发布Claude Sonnet 5.5。这款中端模型据称在多项编程基准测试中超过Opus 5.5,通用任务表现也接近旗舰水平。API价格为每百万输入词元2美元、每百万输出词元10美元;Anthropic称,推理效率提升可使综合成本最高降低30%。文章还提到,模型新增了针对高风险编程请求的防护措施和防抄袭机制。以上信息及测试结果均为文章转述的Anthropic说
蝴蝶效应发布了 Manus 2.0 海外版重大更新。该产品主打任务执行,而非以对话为核心。公司称,新架构可将同类任务的执行时间和运行成本分别降低近 30%。新功能包括由邮件或日历事件触发的自动化工作流,以及视频和游戏制作工具。公司还推出 Cue 应用,支持多个 AI Agent 协同工作。Manus 2.0 能否在市场竞争中胜出,仍有待观察。
长期与环境交互的智能体需要保留并持续更新通过观察和行动获得的信息。EmbodiedMemory-Bench(EMem-Bench)旨在评估这类能力,包含四类任务、共 2,554 个交互回合,要求智能体从过往交互中建立记忆,并在后续任务中加以利用。研究团队还推出外部记忆系统 EMem,用于整理空间、事件和场景记忆;以及能够管理和使用这些记忆的 80 亿参数策略模型 EMem-8B。评测结果显示,现有
该研究分析了大语言模型在可验证奖励强化学习中,推理引擎与训练引擎之间的不匹配。由于两个引擎可能为相同的 token 分配不同概率,研究人员提出校准重要性采样(CIS),根据 token 的置信度限制重要性比率。理论上,CIS 将精确重要性采样中无界的二阶矩替换为有界项,同时控制由此产生的偏差。在三个混合专家模型和五个数学推理基准上的评估中,CIS 在三个模型上均取得了所有比较基线中的最高平均成绩。
AdaTutoRank 是面向检索增强生成(RAG)和深度研究的集合式重排器。它不再仅根据单篇文档的相关性进行排序,而是优化完整、互补且低冗余的文档集合。其自适应指导优化方法从策略模型的冻结快照中生成不同具体程度的提示,并根据每次 rollout 的质量,将提示用于冷启动监督、强化学习和蒸馏。在覆盖 RAG、深度研究和集合评估的十项基准测试中,作者称 AdaTutoRank 在减少检索调用的同时取
YuE2先生成标明旋律与和声的可读乐谱,再将其转换为音乐表征,并据此生成完整歌曲。在研究报告的专家比较中,采用符号化规划的版本比未采用该方法的版本更常获选。作者称,YuE2在WildSongBench上超过了受测的公开基线系统;从八个候选结果中挑选最佳版本时,也优于Suno v4.5,而与Suno v5的比较结果则基本持平。研究还推出用于音乐表征学习的MERT2,以及用于主旋律谱转录的SheetS
OpenAI就涉及澳大利亚政府网站的事件致歉,并提出加强防护措施、提供更多支持,以增强澳大利亚的网络防御能力。
哈佛大学心理学家史蒂文·平克认为,人工智能导致人类灭绝的风险被夸大了。他在致精神科医生、科技博主斯科特·亚历山大的公开信中,拒绝参加围绕AI生存风险的公开辩论,并批评“回形针最大化器”等末日设想。平克认为,更值得重视的现实风险包括生物恐怖主义、网络攻击和缺乏约束的AI智能体。他表示,渲染末日情景无助于解决这些问题,真正有效的做法是开展审慎的安全工程,并建立独立监督、责任机制和人类控制。亚历山大则估