Anthropic称Fable 5.1在典型工作负载下成本降低25%,高度代理式任务最高降45%
Anthropic将发布AI模型Fable的新版本。该公司估计,Fable 5.1在典型工作负载下的成本将比Fable 5低25%,在高度代理式的工作中最高可降低45%。Anthropic还表示,新模型在编程和科学任务方面的表现有所提升。不过,现有信息没有提供独立基准测试或详细数据,尚无法验证这些性能改进。
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Anthropic将发布AI模型Fable的新版本。该公司估计,Fable 5.1在典型工作负载下的成本将比Fable 5低25%,在高度代理式的工作中最高可降低45%。Anthropic还表示,新模型在编程和科学任务方面的表现有所提升。不过,现有信息没有提供独立基准测试或详细数据,尚无法验证这些性能改进。
CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
Google推出了Google Pics,这是一款可在Google Workspace中创建和编辑图像的工具。该应用基于Google最新的Nano Banana模型。
Google 推出面向 Workspace 用户的新创意设计工具套件 Google Pics,旨在让企业更轻松地编辑和生成具有专业水准的 AI 图像。Google Pics 以 Gemini 和生成式 AI 模型 Nano Banana 为基础,为用户通过文本提示创建和编辑图像提供更精细的控制。
Perplexity 已在 Mac 应用中推出 Hybrid Compute。该功能会将工作负载分配给 Opus 5 等前沿云端模型,以及在本地运行的大型语言模型。部分任务由设备本地处理,可能有助于降低成本并减少对云端推理的依赖。Hybrid Compute 现已向 Mac 应用的所有用户开放。
Sonos 计划向第三方 AI 助手开放其平台,利用公司自研的大语言模型升级语音助手,未来还可能让用户创建自己的 AI 代理。首席执行官汤姆·康拉德希望将 Sonos 重新定位为一家不只是音箱品牌的公司。
该研究分析社交媒体上的多模态错误信息,即通过结合文字和图像来误导受众的内容。研究人员从 Twitter/X 收集了涵盖七种语言的大规模真实错误信息数据集,并基于定性分析和既有理论研究构建了综合分类体系。随后,他们利用视觉语言模型(VLM)开发多阶段自动标注流程,并通过人工进行验证。研究发现,人工智能生成内容在科技和科学相关的错误信息中尤其常见;而疫苗错误信息则不成比例地使用新闻媒体图片,以增强可信
腾讯操作系统层级AI助手Marvis现已支持通过通用API标准接入第三方模型。用户可以配置腾讯云、阿里云、DeepSeek、MiniMax、Kimi、智谱和小米等厂商的模型,也可以接入本地部署的开源模型。对话过程中可随时切换模型,配置还可在Windows、Mac、iOS、安卓和iPad设备间同步。Marvis为每位用户提供每日1000万token的免费额度;接入第三方服务后,相关用量将计入用户自己
英伟达正试图挽回 DLSS 5 留下的不佳第一印象。许多玩家看到《生化危机:安魂曲》主角格蕾丝·阿什克罗夫特经过 DLSS 5 处理后的脸部画面后,批评其为“AI 垃圾”。本周,英伟达重新介绍了这项备受争议的“神经渲染”技术,并强调它能够保留艺术意图、尊重已渲染的画面。
SpanCalib-VLM是一种用于定位和评估大型视觉语言模型生成的幻觉文本片段的混合系统。该系统将由XLM-RoBERTa-Large和SigLIP视觉编码器组成的多模态序列标注器,与经过微调的生成模型Qwen3.5-4B-SHROOM-SFT结合。通过Union-Calibrated Fusion策略,系统利用序列标注器校准后的概率,对生成模型提出的候选片段重新评分。在SHROOM-Visio
该研究提出 ContextBias 和 ContextBench,用于评估当职业被置于不同语境中时,文本生成图像模型中的刻板印象视觉关联是否会持续。该基准涵盖 92 种职业和 1,656 个经过语义控制的提示词。研究人员评估了四个先进模型生成的 66,240 张图像,发现与职业无关的语境并未抑制职业相关属性,反而提高了这些属性在不同职业之间的集中程度。人口统计线索、特征性服装和职业专用工具在各种条
中国企业家罗永浩在微博表示,他试驾了数十辆新能源车,却没有发现任何一家车企在车内对话功能中接入豆包、千问或 Kimi 等中国顶级 AI 模型的完整版本。他认为车企可能更倾向于推广自有模型,并直言这些模型的质量不佳。罗永浩称,即使需要额外付费,允许用户使用更优秀的第三方模型也能改善车内体验。相关言论随后迅速登上微博热搜。
中国机器人企业智平方科技已将 AlphaBot 2 部署到香港兰桂坊一家酒吧,负责调制鸡尾酒并与顾客互动。据公司介绍,该机器人搭载具身人工智能模型 NeuroVLA,结合语言理解、任务规划和运动控制。智平方称,这套架构可将机器人运动抖动降低 75% 以上,并在发生碰撞后 20 毫秒内作出反应。公司还将其称为全球首个进入酒吧工作的生产力型通用机器人,但相关说法和性能数据尚未经过独立验证。
EvoGenUI-Bench是一项评估大语言模型能否在用户需求持续变化时维护可执行网页界面的基准测试。该测试包含150个五轮任务,共750轮,覆盖信息展示、可执行交互和工具支撑的外部状态三类场景。生成的界面会在浏览器中运行,并通过截图、源代码与DOM证据、操作轨迹及运行日志进行评估。在测试的8个模型中,表现最好的模型单轮通过率为74.9%,但完整完成五轮任务的比例仅为37.3%。在工具支撑任务中,
一项研究推出了 FACE-Eval,使用5,100个样本评估思维链(CoT)记录是否忠实反映影响模型回答的信息。研究测试了来自8个模型系列的15个开放权重模型,参数规模从40亿到1.60万亿不等。所有模型在接收工具返回内容中的偏好线索时,明确表达受影响程度都低于接收用户消息中的线索,但未明确表达却采纳偏好的比例更高。从原始数据中推断出的隐性线索也呈现类似结果。要求模型标注信息来源的提示,在7个模型