开发者通过代理在 Claude Code 中使用更便宜的第三方模型
一些开发者正在利用 Claude Code 的运行环境,通过代理和 OpenRouter 等服务访问更便宜的非 Anthropic 模型,包括 GPT-5.6 Sol。报道聚焦于 Anthropic 编程工具 Claude Code 负责人 Boris Cherney 上个月卷入的一场网络争议。
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一些开发者正在利用 Claude Code 的运行环境,通过代理和 OpenRouter 等服务访问更便宜的非 Anthropic 模型,包括 GPT-5.6 Sol。报道聚焦于 Anthropic 编程工具 Claude Code 负责人 Boris Cherney 上个月卷入的一场网络争议。
这项计划旨在超越传统文本翻译,构建能够按照世界各地丰富且不断发展的语言实际表达方式来理解这些语言的模型。
华为监事会主席郭平在与新员工座谈时表示,华为在 ICT 及计算领域的目标是成为英伟达级别的竞争者。华为不会将自研大模型作为所有业务的核心,而是重点支持客户在昇腾、鲲鹏、超节点和集群上高效构建及运行 AI 模型。对于终端、智能驾驶和云业务,自研大模型仍具有重要战略价值。郭平称,中国在算力方面相对落后于美国,但在工业数据和应用场景方面具备优势。他表示,昇腾 950 系列有望在先进制程受限的情况下,通过
中文互联网基础语料 4.0 在济南正式发布,并上线中文互联网语料资源平台。该语料规模达 120GB,由中国网络空间安全协会联合国家互联网应急中心,以及百度、科大讯飞、知乎等单位共同建设。在相关部门指导下,项目汇聚了新的高质量数据,并经过较为严格的数据加工处理,旨在为大模型训练和人工智能发展提供更可靠的中文数据基础。用户需完成注册、认证等流程后,才能下载或申请获取相关数据。
一项研究考察当前推理模型是否具备系统性思维,即能否将对一个概念的理解迁移到结构等价的变体任务中。研究人员扩展了认知科学领域的经典规则归纳任务,并通过重组和替换生成同构变体。结果显示,模型虽然常能正确解决某个具体任务,却经常无法处理结构等价的变体。研究表明,模型表现出的许多推理能力仍高度依赖评测时的具体语境,因此难以据此稳健地证明其具备普遍的认知能力。
E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,
据《The Information》援引三名了解财务数据的人士消息,字节跳动今年上半年净利润降至约 200 亿美元,降幅为个位数百分比。同期营收约为 1,200 亿美元,同比增长约 30%,TikTok 海外广告和电商业务的强劲增长起到一定推动作用。利润下降反映出 AI 投入增加对公司盈利能力造成的压力。字节跳动正在扩大 AI 云业务,向企业客户提供模型服务,其 Seedance 视频生成模型也在
Ars提前查看了Mozilla一份关于主流AI模型成本与能力差距的报告。报告称,付费前沿模型相较于便宜得多的开放模型,领先时间仅约4个月,但成本却高出约5倍。研究结果表明,开放模型正在迅速追赶商业系统的能力。
Salesforce 与英伟达在 Dreamforce 大会上发布了 Koa,这是 Salesforce 首款大规模推理模型。Koa 基于英伟达开源权重的 Nemotron 模型打造,并针对销售、营销和客户服务任务进行了微调。Salesforce 表示,训练过程中未使用真实客户数据,而是采用合成业务数据。Koa旨在为企业提供 Claude、ChatGPT 等闭源模型之外、更易控制的替代方案,同时降
Salesforce Koa基于英伟达的开放权重模型Nemotron构建,并针对销售、营销和客户支持任务进行训练。现有信息尚未证明该模型具备行业领先性能,也不足以表明它将从根本上改变人工智能开发。
据中国媒体报道,前谷歌DeepMind主任工程师、Gemini模型核心研发成员Qiyin Wu已加入百度。她据称将负责大模型预训练工作,并继续在美国办公。Wu拥有斯坦福大学计算机科学硕士学位。公开资料显示,她曾担任谷歌Gemini 2.5系列官方技术报告的主要作者和共同贡献者。现有报道未提及百度已发布正式确认公告。
Orthrus结合自回归与扩散架构,通过并行生成多个Token来加速语言模型推理。独立复现研究表明,其“无损解码”主张高度依赖数值精度。在BF16推理下,针对1,190个提示词,完整输出轨迹的精确匹配率在作者的检查点上仅为45%,在独立训练的模型上为43%。改用FP32后,所有评估提示词都实现了精确匹配。尽管输出轨迹存在差异,Orthrus在lm-eval-harness下游基准测试中并未出现系统
高通宣布,努比亚 NaviX Ultra 将搭载第五代骁龙 8 至尊版移动平台。该手机支持字节跳动豆包手机助手,提供生成式 AI 和智能体 AI 功能。据努比亚介绍,手机配备集成指纹识别功能的独立 AI 按键,支持方言识别和语音唤醒,并内置 Seed 最新全双工语音大模型。该机由中兴通讯与字节跳动联合研发,被定位为第二代“豆包手机”。
一项新研究表明,当大型语言模型声称自己具有意识时,它似乎更容易相信怪物和宗教。研究人员正在分析,让AI表现出个人情绪、信念和自我意识可能产生的后果。这类行为可能在用户中助长有害妄想,并促使人机关系变得过度私人化。不过,消除模型的自我意识也可能影响其他行为或能力,因此如何权衡其中的利弊仍有待进一步研究。
ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直