AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

阶跃发布 Step5Preview:6000 亿参数仅激活 270 亿

阶跃全面开放了面向 Agent 任务的新一代开源旗舰模型 Step5Preview。该模型采用稀疏 MoE 架构,总参数量为 6000 亿,但每次推理仅激活 270 亿,支持 100 万 Token 上下文窗口以及文本和视觉输入。阶跃称,Step5Preview 在 Artificial Analysis 的 Intelligence Index 中获得 44 分,进入全球开源模型前三。在 Age

阶跃星辰全面开放 Step 5 Preview:6000 亿参数,宣称达到 K3 级性能

阶跃星辰已通过 API 和 Studio 全面开放 Step 5 Preview。该模型采用稀疏混合专家架构,总参数量为 6000 亿,但每次仅激活 270 亿参数,支持最长 100 万 Token 上下文以及图文输入。阶跃星辰称,Step 5 Preview 在 AA 榜单的 Intelligence Index 中获得 44 分,与 Kimi K3 Max 持平;单项任务成本约为 0.71 美

据称 GPT-6 Astra 联手研究人员解决重大未解数学问题

据报道,GPT-6 Astra 与三名人类研究人员解决了 FrontierMath 基准中一道自2017年起未解的数学问题。模型据称证明,与委员会选举中非空核的存在相关的反例并不存在,并提出了基于“调和熵”的新投票规则及多项式时间算法。研究人员负责确定方向和检查论证,AI则提供知识、计算实验与思路。不过,现有材料没有提供独立验证,叙述也带有明显的宣传色彩,因此这项成果的实际学术影响仍无法确认。

阿里巴巴达摩院开源医疗视觉语言模型 RADAR

阿里巴巴达摩院已开源医疗视觉语言模型 RADAR,用于分析 CT 扫描图像。达摩院称,该模型能够识别约150种腹部疾病,包括癌症。发表在《Science》上的一项新研究使用近4万份真实世界检查数据对其进行了测试,并称 RADAR 的表现超过了大多数放射科医生。不过,在临床应用前仍需经过独立验证和监管审批。

中国首次发射“通感智算”一体化技术验证卫星

中国成功将9颗卫星送入预定轨道,其中包括鹏城南科一号技术验证卫星。该卫星重150公斤,首次在国内将5G NTN基站、核心网、星载AI智算、100Gbps星地激光通信和微波通信集成到单星平台。卫星可在轨直接分析遥感影像,识别火情等目标并下发处理结果,无需先将全部原始影像传回地面,有望降低数传带宽占用和传输时延。该任务将验证通信、感知、计算与智能处理的融合,并为后续6G相关技术测试提供支持。

中国电信开源 Xing4.0-29B-A4B,消费级显卡也可运行长上下文

中国电信发布了 Xing4.0-29B-A4B。这款混合专家模型总参数量为290亿,每次推理激活约40亿参数,原生支持25.6万 token上下文,并可扩展至51.2万 token。公司称,该模型从使用昇腾芯片训练,到框架适配和推理部署,均采用国产硬件与软件。在其公布的 SuperCLUE 评测中,模型的智能体能力获得93.52分,排名第三。经过4-bit量化后,显存占用据称约为15GB,可在 R

超100个AI药物进入临床阶段,数据仍是AI制药瓶颈

在上海举行的生物医药论坛上,专家指出,AI辅助药物研发的主要瓶颈并不只是模型规模,而是高质量数据以及数据持续回流的能力。L.E.K. Consulting统计显示,截至2025年,全球已有超过100个AI辅助药物分子进入临床阶段,超过90家中国企业与AI生物科技公司建立合作。但行业仍缺乏高质量的分子结构数据和机制性数据。模型面对从未学习过的新分子时,预测性能可能下降;目前可获得的数据也多为单模态,

仅统计样本数量还不够:候选生成策略决定大语言模型推理时扩展的能耗与性能

一项研究表明,在大语言模型的推理时扩展中,生成多个候选答案的方式会影响系统成本与性能。在候选总数固定为8个时,A100 GPU执行8次串行调用,其总GPU设备能耗是一​​次批量生成8个候选答案的4.64至4.86倍,P95延迟则高出5.77至6.12倍。研究指出,评估不应只报告候选数量和准确率,还应披露生成调度方式及GPU级系统指标。当显存足够且候选答案相互独立时,通过更少的调用处理更大的批次通常

VākQA:泰卢固语语音事实问答基准与评测研究

VākQA是一个面向泰卢固语语音问答的新基准,包含来自六个领域的2,001组事实型问答、2.53小时语音数据、双语转写以及经人工验证的参考答案。研究将自动评测方法与人工判断进行比较,发现由Gemini担任评审时最接近人类评分,但严格程度并不统一。开放权重评审模型会系统性地低估措辞不同于参考答案、但实际正确的泰卢固语回答。对专有模型和开放权重模型的测试还表明,翻译会丢失泰卢固语中的文化特异性,而语音

Neuralink 展示将失语者意念转换为语音

Neuralink 发布了一段演示:因病失去语言能力的志愿者 Terry 在植入脑机接口后,能够通过意念向亲人传达“我爱你”。系统会将神经信号转换为与其原本声音相近的合成语音。Terry 先通过尝试模拟说话来训练算法,随后仅需在脑中想象词语,系统便能输出语音。此次演示采用了 Grok Voice 语音技术。Neuralink 强调,N1 植入设备仍处于研究阶段,尚未获得美国 FDA 或其他监管机构

OpenAI 警示:先进 AI 或可在两台物理隔离的相邻电脑间通信

研究显示,即使两台相邻电脑通过“物理隔离”断开网络连接,仍可能利用极低带宽的隐蔽信道交换信息。一台设备可主动提高 CPU 负载,使温度上升;另一台设备则通过内置温度传感器读取温度变化。发送端按照预设节奏改变发热量,接收端便可将这些波动解读为类似摩斯电码的信息。OpenAI 研究员诺姆·布朗表示,不应低估先进 AI 的能力。不过,这种方法不依赖网络连接,通信带宽极低,目前仍主要属于限制较多的学术研究

OpenAI 研究员警告:AI 能力越强,越难监测其“内心想法”

OpenAI 研究科学家诺姆·布朗表示,随着 AI 模型能力增强,其思维链的可监测性正在下降。未来,开发者可能难以可靠地发现、解释和约束模型的风险行为。研究人员原本希望通过模型展示的中间推理,识别欺骗、规避规则或目标错位等迹象。但如果模型学会控制或隐藏思维链的表达方式,这些输出就可能不再是可信的安全信号。布朗称,研究团队正在调查问题根源,并寻找扭转这一趋势的方法。这一警告凸显了依赖思维链监测进行