接下来人生的70%,我可能都要问:“这是AI做的吗?”
文章调查了 AI 生成图片和文字为何难以被可靠识别。明显的“AI生成”标识很容易被去除,C2PA 来源元数据也可能在截图、裁剪或压缩后消失。谷歌的 SynthID 隐形水印更耐修改,但不同公司的检测器并不互通,也可能遭到去除和对抗攻击。作者测试多种文本与图片检测工具后发现,知名模型的生成内容有时能够被识别,较冷门模型则经常逃过检测,结果差异明显。文章认为,目前不存在完美的通用检测器。未来与其只关注
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
文章调查了 AI 生成图片和文字为何难以被可靠识别。明显的“AI生成”标识很容易被去除,C2PA 来源元数据也可能在截图、裁剪或压缩后消失。谷歌的 SynthID 隐形水印更耐修改,但不同公司的检测器并不互通,也可能遭到去除和对抗攻击。作者测试多种文本与图片检测工具后发现,知名模型的生成内容有时能够被识别,较冷门模型则经常逃过检测,结果差异明显。文章认为,目前不存在完美的通用检测器。未来与其只关注
谷歌似乎已在 Google DeepMind 网站上线 Gemini 3.8 Flash,但截至目前尚未通过新闻稿或社交媒体正式宣布。该模型基于 Gemini 3.7 Flash,官方称其在软件工程和智能体知识工作流方面有所提升,并继续支持可定制的努力水平,以平衡质量、成本和延迟。模型支持最高 100 万 token 的上下文窗口和最高 6.4 万 token 的文本输出。谷歌公布了涵盖编程、知识
过去一年,美国AI模型的市场份额大幅下降。更便宜的中国替代方案正在取代美国模型,令谷歌、OpenAI和Anthropic在开放AI市场面临更大的竞争压力。
英伟达与CrowdStrike正在开发用于网络安全的新AI模型。报道还提到了Anthropic、Google和World Labs的模型。现有信息未提供具体的技术细节或性能数据。
该研究提出“可归因信用推理”,将视觉语言模型在推理过程中使用的语义单元,与学习时比较不同选择并分配学习信用的位置对应起来。Code-CoT保留图表,并将视觉关系表示为可按行定位的可执行代码,再组织为带类型的事件。CE-GRPO利用结构先验和按类型归一化的熵来确定事件边界,从共享前缀生成完整后续序列,并将结果差异转化为局部优势。在9个几何推理基准测试中,该方法平均准确率达到76.04%,比Qwen3
月之暗面宣布,Kimi API 现已支持 OpenAI 的 Responses API 格式和 Anthropic 的 Messages API 格式。Codex 和 Claude Code 用户无需进行格式转换或使用本地代理,即可通过自定义模型提供商直连 Kimi K3 及其他 Kimi 编程模型。具体配置方法可参考官方文档。Responses API 支持文本和图片输入,但目前不支持视频;如需
谷歌宣布为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能。不同于以固定帧率处理整段视频的传统方式,该功能可动态搜索视频画面、音频和转录文本,仅分析与任务相关的片段。谷歌表示,在标准视频基准测试中,该功能可将分析成本最高降低 66%、Token 消耗量最高降低 88%,同时将准确率提升最多 7%。它可用于亚秒级片段检索、长视频查询、异
数据驻留要求迫使企业自行托管大语言模型,但持续引入新模型而不淘汰旧模型,会扩大服务模型集群并分散有限的 GPU 资源。该方案将 200 多个内部应用的流量整合到一个模型上,并根据生产环境错误分析,围绕指令遵循、函数调用和内部任务分布三个维度进行后训练。团队分别为每个维度训练 GRPO 专家,再通过两阶段 SLERP 合并。在内部 Arena 评测中,该方案超过了总参数量为其 7 倍的基线模型,同时
英伟达已发布 DLSS 5,首批支持《NBA 2K27》,并可用于搭载 RTX 50 系显卡的笔记本和台式电脑,以及 GeForce NOW。不过英伟达表示,目前开启 DLSS 5 可能让几乎所有游戏的性能下降 50% 至 60%。其性能图表中的高帧率也高度依赖 6 倍多帧生成。例如,RTX 5060 在 1080p 下可达到 258 fps,但不使用多帧生成时,游戏实际帧率约为 43 fps。英
Arena 发布的 2026 年第 35 周匿名盲测榜单显示,多款国产新模型在专业领域取得较好成绩。GLM-5.3-Flash 首次进入代码榜便排名第 7,Qwen3.8-Max-0902 则首次上榜即位列前端开发榜第一。同一榜单中共有 4 款国产新模型进入前 12。Anthropic 模型仍主导综合榜和代码榜,月之暗面的 Kimi-K3-Max 继续位居综合榜第 10。Arena 的排名基于匿名
埃隆·马斯克在 X 平台表示,Grok 4.7 预计将在 10 天后,即 2026 年 9 月 12 日发布。该模型据称拥有 2.1 万亿参数,较 Grok 4.6 的 1.5 万亿增加 40%。马斯克称,除运行速度略慢外,Grok 4.7 在各方面都将优于前代,且 Token 效率更高。他还表示,Grok 4.7 上线后将超越所有其他模型。目前,这些性能说法尚未得到独立基准测试的证实。
中国 AI 模型开发商智谱 AI 已在天猫开设官方旗舰店,销售基于 GLM-5.3 的 GLM Coding Plan 订阅服务,支持 ZCode、Claude Code、Codex 等 20 多款主流 Agent。个人版 Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元,团队版标准席位为每席每月 598 元。服务支持按月、季、年订阅。智谱还表示,未来用户可通过电商平台
阿里发布 Qwen3.8-Max-0902,针对编程和专业办公任务进行了进一步后训练。官方称,新版本更适合企业复杂任务、科研以及长周期工作流程。根据 CodeArena 数据,该模型在前端编程总榜中的分数提升 22 分至 1691 分,排名第一。阿里还表示,模型在智能体编程、多步推理、工具调用和端到端应用生成方面均有所提升。CodeArena 更新的性价比榜单显示,Qwen3.8-Max-0902
Safin-1是一系列旨在将安全能力直接融入模型内部计算的基础模型,而不是完全依赖外部防护机制或训练后的对齐。其核心架构MARCH(Memory-Anchor Routing across Context History)维护结构化记忆状态,并从历史上下文中选择性检索相关信息。持久化的能力状态可以在测试时进行调整,无需反复修改模型主干,从而支持受控的专门化。使用专门Safety State的实验显
DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测