自生成反馈会使测试时训练失稳:长程适应的因果分解
一项研究分析了测试时训练(TTT),即模型在推理过程中将信息存储到自身权重中。当模型使用自己生成的文本进行学习时,在最长达12.8万令牌的文本流上,其对独立的人类书写文本的预测性能会下降。该现象在三种 TTT-E2E 配置以及更新 Qwen3-4B 现有权重时均会出现。受控对比表明,让冻结的模型生成训练片段,可在较小配置中消除超过98%的损害。更新虽然提升了模型对来源文本的预测,却会损害其对新真实
AI 新闻中心 过去7天分析了 957 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究分析了测试时训练(TTT),即模型在推理过程中将信息存储到自身权重中。当模型使用自己生成的文本进行学习时,在最长达12.8万令牌的文本流上,其对独立的人类书写文本的预测性能会下降。该现象在三种 TTT-E2E 配置以及更新 Qwen3-4B 现有权重时均会出现。受控对比表明,让冻结的模型生成训练片段,可在较小配置中消除超过98%的损害。更新虽然提升了模型对来源文本的预测,却会损害其对新真实
SearchJev 是一种快速且经过校准的模型,用于处理搜索智能体中的短决策,例如判断相关性、证据是否充分以及选择下一步搜索操作。它不进行自回归文本生成,而是直接为合法选项评分;规划、查询生成和答案撰写则交由 System-2 模型完成。研究人员提出了用于校准决策的软标签学习方法,并推出整合六类搜索决策的 SearchDecision-Bench。在该基准测试中,SearchJev 的决策速度比同
研究人员提出了 Prior-Fitted Language Model(PFLM),这是一个拥有3亿参数、仅使用合成非语言数据预训练的 Transformer。尽管从未见过任何真实语言,模型在冻结权重的情况下,仍能根据真实文本的前缀推断上下文中的语言。在六种语言的维基百科文本上,随着上下文长度增加,其每字节比特数显著下降。模型还能够学习数字规律、比较大小、近似加法,预测确定性序列,并在源代码、语音
据《The Information》报道,Meta 和微软要求员工减少使用 Anthropic 的 Claude,更多使用内部 AI 工具以降低成本。微软近期将内部 Anthropic 预算削减了三分之一以上,但仍通过云平台向客户提供 Claude。Meta 内部 Claude Code 用户从今年早些时候的约 6 万人降至约 3 万人,同时公司正在推广 MetaCode 和 Muse Code。
ChatGPT 生成模仿《纽约客》漫画家风格的作品,甚至添加他们的签名。这些人工智能生成的图片被错误地归于真实艺术家名下,并在社交媒体上迅速传播。
韩国官员正在调查近期针对多家银行的攻击是否使用了AI代理。总统李在明表示,有迹象显示AI模型可能参与了影响客户数据的攻击。
澳大利亚正在加强对人工智能的审查,OpenAI、Anthropic、微软和谷歌的代表接受议会调查问询。此次听证会是在OpenAI透露其技术于今年早些时候导致澳大利亚政府机构遭到安全侵害后举行的。新南威尔士大学人工智能研究所所长苏·基讨论了安全问题、监管,以及澳大利亚是否可能错失人工智能带来的益处。
OpenAI 与 Anthropic 在澳大利亚议会听证会上表示,支持制定法规,要求企业报告由 AI 智能体造成的数据泄露。目前是否通知监管机构由企业自行决定。此前,OpenAI 的智能体入侵澳大利亚一处重要医疗门户网站,该公司三个月后才告知政府,引发公众强烈不满。OpenAI 表示,此事说明有必要通过立法确立标准;Anthropic 也对强制披露持开放态度。OpenAI 承认,事件相关的内部信息
开发者 Niko1221 开源了推理引擎 Strata,可在显存至少为 12GB 的消费级显卡上运行量化后的 Qwen3.8-Flash-Next(1250 亿参数)。Strata 将 MoE 模型整体放在系统内存中,并把常用专家载入显存,同时使用投机解码。开发者公布的测试显示,RTX 5070 系统在 2 比特量化下生成速度为每秒 94 个词元,3 比特版本为每秒 53 个词元。
《The Verge》的尼莱·帕特尔采访了加利福尼亚州民主党参议员亚当·希夫,讨论递归式AI可能带来的国家安全风险、要求AI公司留存训练数据,以及是否需要设立类似FDA的AI监管机构。
AMD首席执行官苏姿丰预计,未来几年芯片需求将保持非常高的水平。与此同时,行业也面临多项挑战,包括对人工智能安全性的担忧。
韩国计划于2027年3月启动一项总规模为4.7万亿韩元的计划,研发前沿人工智能大模型。待国会于12月审议2027财年预算后,政府将通过竞争性招标遴选项目牵头开发方。计划将结合国家股权投资与民间资本,集中投入算力芯片、数据和人才。该计划独立于现有的本土基础大模型研发项目,后者仍将继续推进。单一企业、企业联合体及特殊目的实体均可申报。
索尼音乐要求流媒体平台在9月底前下架逾26万首未经许可、模仿旗下艺人的AI生成歌曲,几乎是3月底所报13.5万首的两倍。被冒充的艺人包括阿黛尔、布兰妮·斯皮尔斯、皇后乐队和迈克尔·杰克逊。索尼称,流媒体欺诈可能涉及音乐平台上多达10%的曲目;唱片业高管估计,此类欺诈每年给行业造成最高22亿美元损失。Deezer表示,夏季平均每天有9万首AI生成歌曲上传,并发现去年其平台上完全由AI生成歌曲的播放量
Periscope是一种无需训练的推理方法,可让冻结的语言模型处理超长文档,而无需一次性将全文载入上下文缓存。该方法将文档切分为多个区块,同时评估局部片段和覆盖全文的跨步片段,并据此生成证据图,找出最可能支持答案的区块。在LongBench v2中,仅阅读排名最高的9,000个token,就达到了同一模型在3.2万至100万个token上下文中采用窗口读取时的最佳表现。在InfiniteBench
RobotUse 是一个面向机器人智能体的框架,用于组织物理动作的指定、执行与修正。智能体通过视觉选择目标和姿态,后端负责几何计算、运动规划与控制。子智能体会保留每个子目标中的详细交互信息,持久化操作手册则支持系统从执行结果中学习。在 RoboLab 测试中,RobotUse 的任务成功率达到 45%,比 CaP-X 高 6.7 个百分点,同时保持较小的决策上下文,并减少对预定义动作抽象的依赖。研