AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

青少年开发者借助 Claude Code,为冷门惠普打印机开发原生 macOS 驱动

青少年开发者 Kuber Mehta 借助 Anthropic 的 Claude Code,为缺乏 macOS 官方支持的惠普 Laser 1008a 打印机开发了原生驱动。该 AI 编程代理协助分析现有软件、逆向打印流程,以及编写和修正代码,约 4 小时便让打印机在 macOS 上运行。最终版本不再依赖惠普专有组件或 Linux 容器,而是采用修改后的开源 SpliX 打印引擎和原生 macOS

OpenAI 开源 Codex Harness 核心组件

OpenAI 已在 Apache 2.0 许可下开源 Codex Harness 的核心组件。该框架负责管理智能体循环、上下文、工具调用、事件流、故障处理和人工审批。此次发布包括命令行工具 codex exec、支持 TypeScript 和 Python 的 SDK,以及采用 JSON-RPC 接口的 Codex app-server。开发者可以将 Codex 智能体嵌入自有产品和业务流程,而不

Liquid AI与Hugging Face发布DSpark草稿模型,推理速度最高提升3.18倍

Liquid AI与Hugging Face发布了LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方法基于投机解码,在贪心解码下不改变输出质量,据称可使GPU整体吞吐量最高提升3.18倍,端侧设备最高提升2.87倍。在端侧智能体场景中,LFM2.5-2.6B的函数调用延迟平均降低57%。使用M4 Max MacBook P

原生支持4K图像输出,商汤开源8B多模态模型SenseNova U1.5 Lite

商汤科技开源了轻量级多模态模型SenseNova U1.5 Lite,模型规模为80亿参数。该模型原生支持3K至4K上下文长度,可同时处理主体、数量、空间关系、文字、布局和风格等多重约束。商汤表示,模型提升了图像生成与编辑能力,包括构图、色彩、材质、光影、真实感、局部细节,以及对未编辑区域的保持效果。它还支持Bounding Box、Visual Marker以及单图和多图参考,以实现更精细的视觉

Google开源Gemma模型下载量突破十亿,拓展至太空与医疗领域

Google DeepMind表示,Gemma系列模型的全球下载量已超过十亿次,开发者还发布了十万多个模型变体。据Google介绍,Gemma已部署在本地设备、边缘基础设施和轨道系统中,用于卫星图像分析、有限带宽优化及通信路由。在印度,Gemma已整合到医疗应用Aarogya Setu中。研究团队还利用Gemma开发医疗数据处理、癌症研究和临床分诊系统。其他项目包括面向医疗场景的MedGemma,

Windows 365 上线五周年,微软计划深化 AI 智能体整合

微软宣布 Windows 365 上线五周年,并计划将 AI 智能体更深入地整合到受管理的云电脑中。Microsoft Scout 可通过 Teams 接收指令,在云电脑上查找文件、总结文档、保存结果,并起草待审核的电子邮件。Windows 365 for Agents 可为智能体配置拥有独立身份和权限的专用云电脑。开发者可使用预装 GitHub、VS Code 和 Node.js 的环境,并通过

蚂蚁百灵开源 Ling-3.0 Tiny 与 Flash 基础模型,公开训练过程关键 Checkpoint

蚂蚁集团 AI 团队百灵开源了 Ling-3.0-tiny 和 Ling-3.0-flash 基础模型。除最终 Base checkpoint 外,团队还公开了预训练和中期训练阶段的 checkpoint,两个模型合计 6 个。Ling-3.0-tiny-base 拥有 79 亿总参数和 13 亿激活参数;Ling-3.0-flash-base 拥有 1240 亿总参数和 51 亿激活参数。这些

Unsloth Dynamic V3 压缩 Qwen3.8-27B,1-bit 版本仅需 8GB 内存

通义千问团队公开感谢 Unsloth 发布 Qwen3.8-27B 的 GGUF 量化版本,并称其更小、更聪明。Unsloth 表示,在文件大小相同的情况下,Dynamic V3 的准确率比其他量化方案高出超过 10%;不过,这些数据来自该项目自行进行的评测。1-bit 版本据称可保留约 77% 的原始准确率,并在 8GB 内存环境下运行。UD-IQ1_S 等高压缩版本约为 6.2GB,相比全精度

DeepSeek Harness 更新多模态支持,或暗示 V4 视觉模型即将推出

发布仅7天后,DeepSeek Harness便推出了多模态功能更新。DeepSeek模型适配器现在可以通过配置启用原生图片请求,但DeepSeek尚未发布支持视觉能力的V4版本,用户也可以改用支持图片输入的第三方模型。/goal、/plan等命令现已支持附带图片,一次提问可以同时引用截图、本地文件和历史会话。MCP与ACP现在能够持久化保存图片附件,PTC Mode也支持转发嵌套图片。此次更新修

开源 AI 模型 Ornith-1.5 系列发布,宣称达到 Opus 4.8 级性能

DeepReinforce 发布了开源 AI 模型 Ornith-1.5 系列。公司称,该系列在训练过程中引入了自我改进循环,让模型持续生成难度更高的任务。旗舰模型 Ornith-1.5-397B 采用混合专家架构,总参数量为 3970 亿,并宣称在部分测试中超过 Claude Opus 4.8。该系列还包括 35B-A3B 模型、稠密型 9B 模型,以及量化版本 Ornith-1.5-9B-Mo

Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理

该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3%

FM-Bench:评估竞争代理长期管理能力的基准测试

FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。C

SemaPLC:面向 PLC 代码生成的项目基础与验证门控代理框架

SemaPLC 是一个用于生成可编程逻辑控制器(PLC)代码的代理框架。它整合传统工具,只有在外部检查确认规格、编译结果以及实时运行环境中的行为后,才会判定任务完成。在涵盖 117 个独立程序组织单元任务、涉及 7 个模型的测试中,SemaPLC 的严格验证通过率平均达到 72.6%。在另一项包含 65 个项目上下文任务的测试中,生成的逻辑必须在现有项目内完成编译并运行;SemaPLC 在集成编译

补齐最后拼图:AI 编程语言 Mojo 开发 4 年后完全开源

在发布 Mojo 1.0 正式版后,Modular 已公开 Mojo 编译器、开发工具,以及从源代码构建该语言所需的全部组件。相关代码已上传至 Modular 的主要 GitHub 仓库,采用带 LLVM 例外条款的 Apache 2.0 许可证。这意味着经过约 4 年开发,Mojo 的开源工作基本完成。Mojo 标准库自 2024 年起接受社区贡献,但公司目前仍限制外部开发者修改编译器和工具,计