微软发布 MAI-Image-2.6-Flash,称生图速度达到全球领先 AI 模型的两倍
微软通过 Microsoft Foundry 公开预览 MAI-Image-2.6-Flash 图像生成模型。该模型支持文生图和现有图片编辑,包括对象移除与替换、局部重绘、属性修改以及文字更新。微软表示,Flash 版相比 GPT-Image-2-Medium 的生图速度提升至两倍,GPU 效率提高 72%。这些数据属于微软公布的说法,尚未经过独立验证。API 价格为每百万 Token:文字输入
AI 新闻中心 过去30天分析了 2416 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
微软通过 Microsoft Foundry 公开预览 MAI-Image-2.6-Flash 图像生成模型。该模型支持文生图和现有图片编辑,包括对象移除与替换、局部重绘、属性修改以及文字更新。微软表示,Flash 版相比 GPT-Image-2-Medium 的生图速度提升至两倍,GPU 效率提高 72%。这些数据属于微软公布的说法,尚未经过独立验证。API 价格为每百万 Token:文字输入
Scan.com在C轮融资中筹集了2.2亿美元,其中包括9000万美元股权融资和1.3亿美元债务融资额度。该公司利用人工智能,根据影像中心的可用性、价格和专业领域,为患者转诊匹配合适的医疗影像中心。
长安汽车副总裁贺刚表示,中国智能驾驶行业预计将在2028年前后完成首轮洗牌,届时具备竞争力的解决方案商可能仅剩五六家。长安自研的“天枢领航”平台分为四个等级,采用激光雷达和一段式端到端架构,最高算力达到1000 TOPS。该平台基于超过2000万段高质量驾驶数据训练,覆盖高速和城市导航辅助,以及全场景泊车功能。首款搭载车型为长安启源Q06,提供纯电和增程两种动力。长安称相关技术累计投入已超过600
谷歌升级了 iOS 版谷歌翻译的实时翻译功能。现在,用户无需连接耳机,即可通过 iPhone 听筒收听翻译内容,在嘈杂环境中也能像打电话一样将 iPhone 17 等设备贴近耳朵使用,从而减少声音对周围人的干扰。最新版安卓版谷歌翻译还支持在后台持续运行实时翻译:用户打开其他应用或锁定手机后,翻译仍不会中断。谷歌表示,超过三分之一的实时翻译会话持续时间超过 5 分钟。
微软计划为 Excel 推出 Copilot Canvas,将工作簿中的图表、关键指标和分析洞察整合到一个交互式视图中。用户可以通过自然语言修改画布内容。该功能会保持与原始工作簿的连接,当用户手动修改数据,或工作簿从其他来源获取更新时,仪表板将自动同步最新内容。微软计划在未来几周分阶段推送 Copilot Canvas,并于 10 月初完成部署。
美国加州 3 名缺乏经验的登山者因轻信谷歌 Gemini 提供的路线和用时信息,最终被困在沙斯塔山。Gemini 告诉他们登顶大约需要 8 小时,但实际攀登耗时约 16 小时。3 人在夜间抵达山顶后开始下撤,途中偏离路线进入 Mud Creek Canyon,其中一人膝盖受伤。由于无法安全下山,他们联系警方求助,并于次日早晨被救援人员找到。事后,登山者承认自己过度依赖 AI,没有进行独立判断。事件
小米已开源通用表格数据基础模型 Xiaomi-TabLDM。该模型完全基于结构因果模型生成的大规模合成数据进行预训练,旨在无需针对每个数据集重新训练或调参,即可完成分类和回归任务。其架构采用双流特征分组、轻量级 Attention Residual、稀疏混合专家和 Test-Time Scaling。根据小米公布的评测结果,TabLDM 在 OpenML-CTR23 回归任务中排名第一,并在 TA
据 9to5Mac 报道,SpaceXAI 已将 Grok Bot 平台扩展至苹果 iPad 和谷歌安卓系统。该服务支持多个 AI 智能体在不同应用和网站中协同执行任务,保留此前任务的信息,并在智能体之间共享相关细节和上下文。Grok Bot 最初仅支持 Mac,如今已覆盖 Mac、iPhone、iPad 和安卓四类终端。服务上线初期要求每月支付 300 美元,目前可通过每月 20 美元的 Cur
七彩虹为灵创 K16 游戏本新增 128GB LPDDR5X 内存和 4TB PCIe 4.0 SSD 版本,搭载 AMD 16 核锐龙 AI Max+ 395 处理器及 Radeon 8060S 核显,售价 39999 元。该机配备 16 英寸 2560×1600、165Hz IPS 屏幕,整机最高可实现 160W 性能释放,并提供 Oculink、HDMI 2.1 等接口。其 Nova Stu
VeriPhy是一套可审计系统,用于评估人工智能生成视频的物理可靠性。在观察任何画面之前,文本规划器会将提示词转换为带类型的物理约束和经过静态验证的执行计划。执行过程中,系统只根据观测结果调用预先指定的低级专家,处理分割、跟踪、计数、深度估计、OCR和音频事件检测等任务。每个判定都保留证据来源,并被归类为支持、矛盾或未知。该系统基于1500段由人工标注、记录生成缺陷的视频。在包含304条缺陷记录的
RoboTok从网络视频中检索与操作相关的人类示范,用于训练灵巧机器人的操作策略。系统根据以行为主体为中心的三维手部轨迹学习潜在运动空间,使其能够在摄像机视角、场景外观和遮挡情况不同的条件下比较操作行为,同时支持对大规模视频集合进行高效搜索和持续索引。评估显示,RoboTok检索到的示范比现有方法更相关,并提升了机器人在后续操作任务中的成功率。
一项研究提出了开放词汇互信息(OVMI),这是一种基于信息论的指标,可在统一尺度上比较语音脑机接口。由于不同系统使用的数据集、记录方法、语音类型和词汇各不相同,现有性能数据难以直接比较。OVMI同时考虑用户可能希望表达的词语分布,以及解码器能够传递的信息量。研究显示,只针对系统支持的词语计算准确率和词错误率,可能高估系统实际传达用户意图的能力。通过选择能够最大化OVMI的词汇,在三个语音领域中,相
开发者 Daniel Blanco 发布了“DLSS-NR for AMD”工具,可让搭载 RDNA 4 架构的 AMD 显卡运行英伟达 DLSS 5。该工具已在《赛博朋克 2077》和《GTA V:增强版》中完成测试,但目前性能仍不理想。在 Radeon RX 9070 XT 上,早期版本使《赛博朋克 2077》1080P 帧率从 80 多 FPS 降至约 11~12 FPS。据报道,Alpha
科沃斯在 IFA 2026 期间表示,公司已成为全球最大的家用机器人品牌。公司称,其产品已进入 180 个市场,覆盖超过 3,800 万户家庭。产品研发方面,科沃斯计划尽可能复用核心技术,再针对不同使用场景进行适配。目前其产品覆盖地面、窗户和草坪清洁,并通过 Ultramarine L1 Pro 进入泳池清洁领域。2026 年第二季度,国际市场收入占公司总营收的 51%。
根据微软提交的法庭文件,一名由出版商聘请的专家发现,在820万条Copilot聊天记录中,约6万条包含至少16个与新闻内容重合的词语,占比不足1%。这项分析是围绕微软人工智能助手是否复现受版权保护的新闻内容而展开的法律纠纷的一部分。