腾讯加速大模型迭代,混元Hy4预览版参数规模翻倍
腾讯提前发布混元Hy4预览版,时间早于摩根士丹利此前预期的9月。Hy4采用混合专家架构,总参数量达7700亿,激活参数量为490亿;上一代Hy3分别为2950亿和210亿。模型上下文窗口也从25.6万token扩大至100万token。腾讯表示,Hy4在内部双盲评测中获得4分满分中的2.99分,并在第三方代码能力榜单中位居前列。不过,部分性能说法依赖内部评测或公开细节有限的比较。摩根士丹利维持对腾
AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
腾讯提前发布混元Hy4预览版,时间早于摩根士丹利此前预期的9月。Hy4采用混合专家架构,总参数量达7700亿,激活参数量为490亿;上一代Hy3分别为2950亿和210亿。模型上下文窗口也从25.6万token扩大至100万token。腾讯表示,Hy4在内部双盲评测中获得4分满分中的2.99分,并在第三方代码能力榜单中位居前列。不过,部分性能说法依赖内部评测或公开细节有限的比较。摩根士丹利维持对腾
海信发布面向电视的 AI 操作系统 JUOS,称其可根据用户、时间、环境和家庭情境,提供个性化内容与服务。JUOS 搭载海信自研的星海大模型,提供 7B、32B 和 72B 版本,并配备情境理解、多 Agent 协同和任务执行等引擎。系统支持按家庭成员定制桌面、根据观看习惯推荐内容、通过剧情描述搜索影视内容,以及海信所称的行业首创 AI 搜索片段功能,可直接定位影片中的特定片段。它还可以理解屏幕内
据中国媒体报道,字节跳动已将豆包虚拟股的内部价格从每股14.85美元上调至17.02美元。此次调整据称主要面向Seed旗下的大模型团队,包括预训练、多模态模型和VLM,以及豆包应用相关员工。部分员工可获得约占总薪酬5%的豆包股,也可以将部分现金薪酬兑换为虚拟股。可兑换比例因职级而异,报道提到20%、25%和30%等档位。字节跳动还据称正在测试面向豆包业务的长期激励计划,符合条件的员工可选择将部分年
该研究分析了递归快速权重记忆和选择性状态空间模型。这些模型将不断增长的上下文压缩到固定大小的递归状态中,并在因果性的读后写语义下把状态转移视为在线学习规则。作者针对平方误差回归和负内积目标推导了归一化更新,涵盖 Falcon-1、Falcon-2、Falcon-3 及其内积变体,同时提供递归、掩码并行和分块并行形式,以及数值稳定的正衰减重新归一化。代表性变体在语言建模中仍具竞争力,并改善了可变位数
Ring Forcing是一种面向自回归视频扩散模型的框架,旨在提升数分钟视频的长期一致性。它同时解决两个问题:物体重新出现时能否准确保持其外观,以及模型能否处理超长上下文并利用遥远历史中的信息。环形训练策略促使模型从较早的历史中检索信息。压缩与时间步组合策略在固定序列长度下扩展了有效历史范围;稀疏RoPE机制则支持更灵活、可扩展的记忆适配。论文报告的实验结果显示,Ring Forcing在数分钟
研究人员提出了 Parallel Tube Decoding(PTD),用于更高效地定位视频中被指代的事件和目标。不同于通过自回归方式逐帧生成密集轨迹,PTD 将时间定位与空间定位分离,并行解码空间模块。因此,无论轨迹长度如何,顺序解码深度都固定为两轮。在 VidSTG 基准测试中,PTD 相比标准自回归解码将完整轨迹的完成延迟降低了 79 倍,并将空间解码吞吐量提升了 92 倍,同时提高了定位准
据报道,字节跳动近期在豆包业务说明会上,针对相关员工推出新的股权激励政策。豆包股评估价格从每股14.85美元上调至17.02美元,涨幅约14.6%;整体发放规模也将大幅增加。部分员工获得的豆包股价值可能达到总薪酬的约5%。此外,员工可根据职级等因素,将部分现金薪酬转换为豆包股,最高转换比例据称为20%至30%。此举旨在增强对AI核心人才的吸引和留存,并支持豆包大模型生态的持续开发与商业化。
多名未具名科技消息人士称,OpenAI已完成代号“Bel”的基础模型预训练,参数规模据称达到约10万亿。该模型被描述为“Doug”的后继者,在编程、推理和长时程智能体任务方面超过“Astra”,并可自主运行数日、自我恢复以及协调数百个并行子智能体。消息还称,它可能在今年年底前或“Astra”发布后数月内亮相。但OpenAI尚未官方确认模型名称、参数规模或性能,相关说法也没有独立证据支持。
Poor Lab 发布了 Puro-2B,这是一套旨在降低消费级硬件语言模型预训练成本的开源方案。研究团队使用 RTX 5090 GPU、FP8 精度和最多 1.4 万亿个 token,从零训练了多个 Puro-2B 模型。根据团队的评测流程,最佳模型以低于 6,900 美元的训练成本,取得了接近 Qwen2.5-1.5B 的性能。成本扩展分析显示,约 4,400 美元可能足以达到 Qwen2-1
LayerRecall是一种面向自回归视频扩散模型的状态条件、分层选择式记忆路由器。它检索相关的历史键值状态,仅将其注入对长程记忆敏感的网络层,同时在其他位置保留局部注意力。其跨时域预测匹配方法利用拥有完整长上下文的参考信息训练有限记忆路由器,减少对显式记忆分配标注的依赖。在100个多镜头提示的评测中,LayerRecall在MemoBench和MovieBench上取得最佳综合结果,在VBenc
EASEL 是一项用于评估多模态智能体在闭环环境中精确使用视觉工具能力的新基准。核心任务要求智能体逐步在数字画布上作画,使结果匹配参考图像,同时测试区域标注、手写和路径规划。EASEL-Data 包含 44 万条训练样本。基于该数据训练的 EASEL-9B 相比基础模型取得 6.3% 的相对提升,在 25 个受测模型中排名第三。不过,结果表明当前多模态智能体仍存在明显不足:图像重建相似度较低,动作
科大讯飞计划于9月1日开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用模型。两款模型均原生支持最长100万token的上下文窗口,并重点提升智能体交互、数学计算和基础通用理解能力,面向车载终端、智能硬件及其他联网设备。公司还计划于9月7日发布参数规模达2930亿的星火X2.5基座模型,进一步升级代码生成和智能体协同能力。此外,科大讯飞表示将在后续推出一款基于全国产算力的新主力通用大模型。
中国信通院人工智能研究所发布的测试报告称,StartLux-V1.0-27B-Preview 在面向 AI 智能体的 MCP 基准测试中取得综合第二名。该模型拥有270亿参数,据称超过了参数规模更大的 DeepSeek 和 Step 模型,并在位置导航、浏览器自动化和金融分析等任务中与 DeepSeek-V4-Pro 持平或取得更好成绩。StartLux 以 Qwen3.6-27B 为基础,采用自
J-Zero 是一种无需额外训练数据、用于推动语言模型自我改进的框架。Challenger 生成难度不断增加的任务,Solver 学习给出质量更高的回答;与此同时,Judge 根据回答的生成方式,利用顺序预先确定的偏好对进行自适应。作者报告称,与基线方法相比,J-Zero 在可验证领域平均提升 4.2 分,在不可验证领域提升 8.0 分。J-Zero 至少持续迭代改进了十轮,而基线方法在两轮后出现
腾讯表示,混元 Hy4preview 于8月28日接入 WorkBuddy 后,凭借升级的 Agent 能力引发较高需求。上线首日出现任务排队,公司随后紧急扩容 Hy4preview 推理集群,并将继续动态调配资源。腾讯同时提醒,在调用集中于高峰时段时,仍可能再次出现短时等待。作为过渡措施,Hy3 等既有模型的 WorkBuddy 限时免费权益延长至2026年9月30日。公告未披露具体使用量,也未