人工智能揭示劳动力市场的隐性缺陷
关于人工智能对劳动力市场影响的首批可信证据近日发布,初步结果对女性而言令人担忧。人工智能究竟会缩小还是扩大现有不平等,可能更多取决于组织如何安排和管理与人工智能相关的工作,而不是技术本身。
AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
关于人工智能对劳动力市场影响的首批可信证据近日发布,初步结果对女性而言令人担忧。人工智能究竟会缩小还是扩大现有不平等,可能更多取决于组织如何安排和管理与人工智能相关的工作,而不是技术本身。
据中国媒体报道,腾讯混元资深研究员徐灿近期已加入微信 WeLM 团队,负责大语言模型研发。徐灿此前在混元 LLM 体系中负责一个后训练方向,并曾参与微软小冰、必应、WizardLM 和 Phi-3 等项目。此次转岗发生在微信持续强化自研大模型和智能体能力之际。微信据称正在测试 AI 助手“小微”,并招聘 WeLM 推理优化及智能体方向的研究人员。
百灵团队与开源社区共同维护的本地大语言模型后训练工具包 AReno,展示了一套轻量级智能体强化学习流程。团队在 DGX Spark 环境中,以井字棋作为验证任务,对总参数量 79 亿、激活参数量 13 亿的 Ling-3.0-tiny 进行后训练。通过规则化奖励和 GSPO 算法完成 400 个训练步骤后,模型的平均奖励提升,非法动作减少,工具调用和动作选择也更加稳定。这项工作提出了一套可复现的方
腾讯研究员徐灿已从混元团队转岗至微信事业群,加入 WeLM 大模型团队,负责后训练和 AI Agent 开发。徐灿曾任微软亚洲研究院研究员,主导 WizardLM 项目,并在 Evol-Instruct、合成数据和自动评测方面积累了研究经验。此次调整发生在微信加快 AI 功能落地之际。微信 AI 助手“小微”目前正在小范围测试,支持通过语音或文字操作微信功能,并调用小程序。WeLM 团队还在研发高
智谱正式发布 GLM-5.3。该模型沿用 GLM-5.2 的基础模型,但通过大幅增加后训练和强化学习提升能力。智谱称,GLM-5.3 在内部编程评测中的表现提升 50%,并在 Terminal-Bench 3.0、Agents' Last Exam 等公开基准测试中位居开源模型首位。其 Terminal-Bench 3.0 得分从 4.6 提升至 28.3,DeepSWE v1.1 得分从 46.
LiveAnimate 是一种姿态驱动的人物动画系统,可根据单张参考图像和实时姿态流生成目标人物视频。该系统基于拥有140亿参数的视频扩散变换器,采用区块因果自回归生成、三步采样蒸馏,以及用于在长时间串流中保持外观和身份一致性的有限注意力缓存。在两块 NVIDIA H100 GPU 上,系统达到每秒19.63帧。在三分钟测试中,研究人员报告其感知质量和身份一致性基本保持稳定,而此前系统会随时间明显
UniSwap是一种用于流式替换说话视频中人物外貌和声音的框架。系统输入参考图像与参考语音,通过单一音视频扩散Transformer迁移视觉身份和声音音色,同时保留原始动作、场景、语言内容以及音画同步。针对跨身份配对训练数据稀缺的问题,研究人员提出了交换与重建训练流程。流式适配、KV缓存和高效扩散技术将每个区块的去噪步骤从30步减少到3步。实验结果显示,该方法具备较好的音画同步、具有竞争力的身份保
DreamX-Phi 1.0是一种面向机器人操作的视频世界模型,可根据观测帧、语言指令以及由末端执行器位姿和夹爪状态组成的动作序列,预测未来观测结果。模型通过将SE(3)几何变换注入注意力机制,保留各机械臂的身份和指定运动轨迹。轻量级深度分支用于增强场景几何建模,SAM3掩码与冻结的V-JEPA教师模型则帮助维持抓取过程中小型操作物体的一致性。此外,研究人员将多步生成器蒸馏为少步模型,以提高部署效
Evoke 是一种交互式世界模型,旨在兼顾持久记忆、快速响应和长时生成。它将场景几何信息存储在外部的相机索引世界状态库中,只检索与当前视角相关的信息,从而使去噪器上下文不会随着会话长度增长。教师模型结合分块分组、远距离帧选择性检索和线性注意力全局状态,在内存和计算量线性增长的情况下提供长时监督。通过自强制 rollout 训练的 30 秒分布匹配目标,将这些能力迁移到三步学生模型中,在保留提示词和
AutoDesign是一种框架,通过元级Harness优化器利用执行反馈,引导代码智能体反复改进自身的Harness。研究团队以学术论文生成海报为任务,使用新基准PosterBench进行评估。在主赛道中,AutoDesign取得78.32分,比Claude Design高7.45分。在七种代码智能体和模型配置中,整合学习得到的DesignHarness后,平均得分从54.99提升至67.39。完
Intern-S2-Preview是一系列面向科学研究的智能体基础模型,支持多模态理解、推理、生成和长周期任务。其训练流程结合科学多模态预训练、监督微调、可扩展的多任务强化学习、智能体强化学习和在线策略蒸馏。3970亿参数模型还将时间序列建模扩展到科学信号理解和数值预测。独立的Memory Decoder可以在不修改冻结的397B主干模型的情况下,快速进行科学领域专项适配。根据公布的评测结果,该系
研究人员提出了 Spatial Memory Agent(SMA),这是一种运行时框架,能够在不更新模型参数、推理时也不依赖外部空间工具的情况下,提升冻结式视觉语言模型(VLM)的空间推理能力。SMA收集经过验证的空间经验,通过验证器引导的反思将其提炼为简洁且可迁移的经验规则,并根据后续检索结果为每条规则分配迁移可靠性分数。在部署阶段,系统通过语义筛选以及结合相似度和可靠性的排序机制检索相关规则,
该研究首次系统分析了交错使用线性注意力层和完整注意力层的混合大语言模型中的大规模激活。研究人员发现了两种与架构相关的形态:完整注意力层之前会出现激活尖峰,激活还可能持续穿过中间的线性注意力层,形成间歇平台。这些现象在五种线性注意力架构、六种混合配置、五个数据领域,以及参数规模从12亿到3970亿的开源模型中均得到观察。针对较小型 Gated DeltaNet 混合模型的受控实验表明,两种形态在训练
PlayWorld 是一个通过长期交互目标评估视频世界模型的基准。由于不同模型实现同一目标所需的动作序列可能差异很大,使用固定动作进行评测难以公平比较,因此研究人员让多模态代理玩家与各模型互动。该基准包含 171 个场景,评估几何一致性、交互保真度、视野外变化、状态持续演化,以及视频质量和可控性。对九个先进世界模型的实验显示,当前系统在长期交互目标上仍不可靠,尤其难以维持空间一致性和持续的状态变化
CLUE 团队最新发布的 SuperCLUE-Terminal 评测显示,DeepSeek-V4-Pro-0813 得分 51.52 分,排名第二,仅次于获得 60.61 分的 Kimi K3,同时超过 GLM-5.2 和旧版 DeepSeek-V4-Flash。根据公布结果,该模型每道题的调用成本约为 1.42 元,约是 Kimi K3 的十四分之一。评测面向中国开发者,采用真实中文编程任务,并