AI 新闻中心

AI 新闻中心 过去一年分析了 1725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

微软推出 MAI-Code-1.1-Flash 编程模型:性能提升,价格降至四分之一

微软推出了 MAI-Code-1.1-Flash,这是面向 GitHub Copilot 工作负载优化的编程模型升级版。微软表示,通过 Copilot CLI 使用时,该模型在 Terminal-Bench 2.1 测试中的表现提升 22%,在 .NET 相关任务中的表现提升 15%。其 Token 生成速度提升 25%,完成相同任务所需的 Token 数量减少 25%。价格降至初代模型的四分之一

Anthropic CEO 阿莫迪不断警告 AI 末日,投资人逐渐失去耐心

根据 Polymarket 预测,Anthropic 可能在 10 月底进行 IPO,部分投行人士估计募资额可能超过 600 亿美元,但相关计划尚未得到确认。潜在上市让投资者开始要求 CEO Dario Amodei 少谈 AI 灾难风险,多谈营收和盈利。阿莫迪长期警告 AI 可能造成大规模失业、协助制造生物武器、发动网络攻击,并获得越来越强的自主行动能力;他还主张对强大模型实施强制测试和监管。文

面向多语言机器翻译的开放式大语言模型无参考后训练

一项研究探讨了开放式大语言模型在46种语言机器翻译任务中的无参考后训练方法。研究人员以监督微调的MiLMMT-46-v0.1模型为基础,采用Group Relative Policy Optimization(GRPO),奖励信号取自两个无参考质量评估模型的平均值,并加入语言识别门控。随后,他们对监督微调和强化学习模型的检查点进行线性插值,得到MiLMMT-46-v1.0。根据论文报告的评测结果,

iFAN:面向普通掩码 Transformer 的推理感知学习

研究人员提出 iFAN,一种用于图像分割掩码 Transformer 的训练框架。现有基于查询的解码存在两个不匹配问题:概率分数最高的查询不一定能生成最准确的掩码,最终层解码也可能丢弃中间层更优的预测。iFAN通过调整后的概率—掩码排序,使查询竞争更符合掩码质量,并通过跨层自蒸馏将更强的中间层预测传递到最终层。这些机制仅在训练阶段使用,因此推理仍保持高效。在COCO、ADE20K和Cityscap

Ex-Omni-2D:具备原生视觉呈现能力的表现力全模态对话模型

Ex-Omni-2D 是一个多模态对话框架,可生成结合文本、个性化语音和参考条件视频的协调式响应。系统接收多模态查询、参考图像和音频后,先预测描述场景、情绪与动作的视觉思维计划,再生成响应文本和语音单元。共享的声学—时间接口能够将语音与视频帧对齐。研究人员将完整序列视频生成器蒸馏为更高效的流式模型,以支持增量生成。在四步推理和四张 GPU 的流水线中,系统在 400×720 或 720×400 分

奕境总经理曾清林:华为智驾仍处于行业顶级水平

东风汽车集团与华为联合打造的汽车品牌奕境,其总经理曾清林发文谈及双方合作。他表示,凭借896线激光雷达、ADS 5以及累计130亿公里的智驾数据,华为的智能驾驶技术仍处于行业顶级水平。曾清林还指出,先进软件需要强大硬件支撑。奕境X9将华为智驾系统与东风全铝底盘、奕境自有的“天穹智盾”安全架构结合,以提升整车性能。这款定位家庭旗舰级六座SUV的新车于8月10日首秀,支持华为乾崑智驾ADS 5,并配备

Mendel Gödel Machine:通过比较进化实现递归自我改进的编码智能体

Mendel Gödel Machine(MGM)是一种让编码智能体反复重写自身源代码、持续自我改进的框架。不同于通常一次只依据单条失败轨迹进行自我修改的方法,MGM利用不断扩展的历史尝试档案中的比较信息。它引入了基于智能体在多个任务上的轨迹进行修改的变异方式,以及利用其他谱系智能体在同一任务上的轨迹进行混合改写的方法。理论分析和受控模拟表明,这些策略比单轨迹基线收敛更快、效果更好。在SWE-be

超越像素:从视频先验到4D世界

该研究提出 Latent-to-4D,用于根据文本或图像条件生成动态3D场景。与先重建RGB视频、再交由独立4D模型处理的方法不同,该方法将视频模型最终去噪后的潜在表示作为显式4D预测的可复用接口。研究人员使用约1,000段重建视频训练了一个检查点,并可将其原样迁移到多个使用同一VAE系列的视频扩散Transformer上。在Text4D-200和I4D-200数据集上,Latent-to-4D的

SPIEval评估大语言模型处理分散个人信息的移动助手能力

SPIEval是一项由人工整理的基准测试,用于评估大语言模型作为移动助手时,从多个应用中检索和整合分散个人信息的能力。该基准包含250项任务、来自10个应用的4,335条个人记录,以及支持多轮交互的21种工具,覆盖推理、消歧、信息整合、偏好推断和多意图分解等能力。在对9个具有代表性的LLM进行评估后,表现最佳的GPT-5.5(xhigh)准确率也仅为57.3%,最弱模型为16.4%。79%的失败源

上海发布软件产业“十五五”规划,目标规模达4万亿元

上海市经济和信息化委员会发布软件和信息服务业“十五五”发展规划,提出到2030年将产业规模提升至4万亿元,并把上海建设为人工智能应用的重要基地。规划支持探索Transformer之外的下一代模型架构,包括状态空间模型和循环神经网络变体,同时布局物理智能、世界模型、量子智能和类脑智能等方向。上海还将推进超大规模智能算力集群组网,提升高性能计算芯片、高速光互连、高带宽内存和异构服务器等环节的供给能力,

Gated Hindsight Distillation让移动端GUI智能体从下一张截图中学习

GUI智能体通常使用成功的交互轨迹进行训练,但标准模仿学习会丢弃每次操作后出现的屏幕。下一张屏幕可能包含解释操作为何正确的关键证据,例如只有菜单打开后,智能体才知道应点击“编辑”或“查看”。Gated Hindsight Distillation(GHD)在训练中将下一张截图作为特权信息。学生模型只能看到可观察的轨迹前缀,而共享参数的教师模型还会查看下一张截图,并重新评估学生在实际执行中的响应。只

AI 公司面壁智能启动 IPO 筹备

面壁智能(ModelBest)于 2026 年 8 月 11 日在北京证监局办理首次公开发行股票并上市的辅导备案登记,中信证券担任辅导券商。公司没有控股股东,第一大股东持股 16.45%。面壁智能于 2022 年由清华大学自然语言处理实验室孵化,主要开发高效端侧大语言模型并推动开源生态,代表产品为 MiniCPM 端侧模型系列。

VectraYX-Vision-1B:面向西班牙语和拉丁美洲网络安全的20亿参数以下视觉语言模型

VectraYX-Vision-1B是一款拥有10.4亿参数的开源视觉语言模型,专门处理西班牙语和拉丁美洲网络安全图像。模型面向IDA、Ghidra、Wireshark、Nmap、Metasploit和Volatility等工具界面,支持结构化输出、通过Model Context Protocol调用工具,以及使用llama.cpp在CPU和隔离环境中部署。然而,初步评估显示其视觉对齐能力接近于零

IT早报0812:豆包否认酒店推荐抽佣12%;DeepSeek据报筹备编程智能体

本期科技简报包含多条人工智能相关消息。豆包否认酒店推荐收取12%佣金的说法,称目前生活服务业务没有付费推广,商家不能通过付费影响推荐或排序,仅在订单成交后支付渠道服务费。关于DeepSeek创始人梁文锋财富大幅增长的报道,尚缺乏独立确认。另有用户称,DeepSeek深度思考模式会给用户临时取外号;公司回应称这只是临时标签,不会作为记忆保存。阿里巴巴千问App推出办公助理和AI视频生成两类付费服务。

超越序列顺序:面向 Transformer 的语法信息位置嵌入

研究人员提出了语法信息位置嵌入(SiPE),在预训练期间将依存句法分析得到的语法信息注入 Transformer 使用的多种位置编码方案。最佳注入方式取决于模型架构。与未采用语法监督的基础模型相比,SiPE 使 SyntaxGym 性能最高提升 10.3%,同时将困惑度降低 9.0%。GLUE 得分也最高提升 8.2%,表明该方法的收益不仅限于语法泛化。在推理阶段,SiPE 只使用单一句法分析结果