从模式识别器到个性化陪伴者:大型语言模型在心理健康领域的综述
本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。
AI 新闻中心 过去7天分析了 224 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
该报告介绍了 Ovis-Embedding,这是一系列全模态嵌入模型,利用统一的多模态骨干网络,将文本、图像、视频和音频编码到共同的表示空间中。该方法以预训练的 Qwen-Omni 模型为基础,结合对比学习、覆盖多种模态的高质量数据集,以及聚焦损失和基于相似度的嵌入蒸馏等专用技术。低秩特征分解能够在性能损失有限的情况下生成维度灵活的紧凑嵌入。报告中的评测显示,Ovis-Embedding 在 MM
RULER 是一种从自然语言指令生成 SVG 代码的优化方法。由于开放式矢量图形任务通常没有唯一的视觉标准答案,CLIP 和 Aesthetic 等标量指标难以准确评估此类内容,用作强化学习奖励时还可能引发奖励投机。RULER 针对每条指令生成包含六个项目的实例感知式评分规则,覆盖语义、视觉和风格维度。视觉语言模型逐项评估渲染后的 SVG,再通过 Group Relative Policy Opt
AIDE^2 是一个能够修改 AI 研究智能体自身代码的系统。它在研发任务上评估修改后的版本,并保留表现最佳的改动。在一次持续 8 天的自主运行中,系统发现了 7 项连续改进,包括新的搜索策略,以及压缩和管理不断增长的上下文的机制。这些改进还迁移到了 4 个未参与筛选的基准测试,涵盖机器学习工程、启发式算法工程和基于物理的天气预报。最强版本的表现达到或超过了一款由人类设计、实力较强的生产级研究智能
Flash-dLLM是一种无需训练的推理加速框架,旨在提升扩散式大语言模型(dLLM)的运行效率。研究发现,在启用KV缓存的dLLM推理中,GPU内存I/O是主要瓶颈,因此提出I/O感知的融合式KV缓存内核,以减少冗余的数据搬运。该方法还采用由KV缓存驱动的草稿生成与验证策略,由同一个dLLM同时充当草稿模型和验证器,无需额外辅助模型。在数学推理和代码生成基准测试中,Flash-dLLM在推理速度
世界卫生组织(WHO)于2026年9月21日发布《人工智能相关健康研究:伦理审查与监管》报告。报告指出,人工智能能够加速科学发现、改善医疗成果,但如果缺乏有力的伦理保障和监管,也可能威胁人权、社会公平、隐私和公众信任。现有伦理审查机制需要更好地应对算法透明度、偏见、公平性、问责制、数据保护,以及快速部署AI工具可能带来的风险。报告将相关健康研究分为三类:利用AI开展健康数据研究、使用AI工具和技术
一系列引人注目的数学成果演变成声誉危机后,OpenAI正向人类数学家寻求建议,以制定更负责任的后续方向。该公司宣布成立独立数学家小组,负责就OpenAI及其他人工智能企业如何对待和参与数学研究提供咨询。
一项研究显示,新加坡人是最愿意接受人工智能代理代为购物的人群之一。但与此同时,他们也希望对这类人工智能系统设置最严格的安全保障和使用限制。
一项新研究分析了在大语言模型的完整强化学习流程中使用 FP8 所导致的不稳定问题。研究人员发现,累积的 FP8 量化噪声会扭曲重要性比率,并错误地将负优势 Token 的梯度归零,从而引发训练中途熵异常激增和输出乱码,使异常结果不断累积。为解决这一问题,研究提出“Calibrated Clipping”,通过动态调整 FP8 的裁剪范围,使其与高精度 BF16 分布保持一致。在 GRPO、DAPO
ACLArena 是一个用于系统研究 AI 智能体跨多个训练阶段持续学习的框架。研究从模型层面和词元层面分析遗忘与泛化,并比较多教师在线策略蒸馏、自蒸馏微调和模型合并等方法。提出的方案将高质量轨迹的离线回放,与由强化学习分别专门化的多个 LoRA 专家组成的路由网络相结合。在四项推理和智能体任务上的实验表明,该方法能够更好地保留已有能力并学习新能力,在训练域外也表现出一定效果。
彭博社记者埃德·勒德洛分析了阿里巴巴推出的新款人工智能芯片。这款加速器旨在与英伟达竞争,并支持未来数年数据中心容量的大规模扩张。他还采访了安德烈森·霍洛维茨学院创始人兼首席执行官加根·比亚尼。该学院是硅谷面向人工智能时代的另类教育机构。此外,人工智能先驱李飞飞讨论了人工智能安全争议、与中国的竞争,以及构建世界模型日益加剧的竞赛。
OpenAI提出了对前沿AI模型及其安全防护措施开展严格、安全且独立的第三方安全评估所应遵循的优先事项和原则。
研究人员提出了一种预标记化框架,将大小写、变音符号和字符重复等正字法变化表示为作用于规范基础词元的可逆运算符。该方法以更小的词汇完整覆盖自然语言和代码语料库;在无约束测试中,所需词汇槽位最多减少19.7%。在拥有9800万参数的GPT-2模型上,Python代码的语法有效率从7.70%提高到9.12%,自然语言文本中的重复n-gram也有所减少。不过,该方法仍需在生产规模上进一步验证。
研究人员提出“内部识别探测”(PIR)方法,用于判断语言模型是知道答案却拒绝透露,还是确实不知道。该方法向模型提供问题、正确答案和多个合理干扰项,再分析模型的内部状态,以识别模型真正认识的选项。在来自五个系列的八个模型上,PIR取得了0.70至0.87的平衡准确率,显著高于未知项目基线和随机水平。面对提示诱导的欺骗、训练产生的隐瞒行为,以及通过密码锁定或电路阻断的模型时,该方法仍然有效。当遗忘训练