The Tasteful Agent:衡量和提升长程任务中的决策能力
一项新研究考察了大型语言模型代理在工程和科研等长程任务中,能否在关键决策分岔点选择正确方向。研究人员推出了 Taste-Bench,从代理执行轨迹中的决策分岔自动构建测试题。表现最好的受测模型也仅答对了 59.7% 的问题。当决定性证据要到轨迹后期才出现时,相关分岔明显更难;增加推理预算也没有提升准确率。不过,研究表明这种能力可以训练:通过蒸馏一个了解最终结果的教师模型的判断,学生模型在未见任务上
AI 新闻中心 过去一年分析了 7962 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项新研究考察了大型语言模型代理在工程和科研等长程任务中,能否在关键决策分岔点选择正确方向。研究人员推出了 Taste-Bench,从代理执行轨迹中的决策分岔自动构建测试题。表现最好的受测模型也仅答对了 59.7% 的问题。当决定性证据要到轨迹后期才出现时,相关分岔明显更难;增加推理预算也没有提升准确率。不过,研究表明这种能力可以训练:通过蒸馏一个了解最终结果的教师模型的判断,学生模型在未见任务上
StableVQ 针对自回归和掩码图像生成模型所使用的离散视觉 tokenizer 的训练不稳定问题提出改进方案。作者认为,问题源于编码器—解码器与 codebook 的训练相互纠缠,使系统在训练压力较大时容易失稳。该方法通过 Dynamic STE 改进编码器的学习目标,利用 Region VQ Loss 让 codebook 能够独立跟踪编码器输出分布,并采用解耦训练计划,为两个子系统设置不同
DeepSeek 发布新论文,公开了名为 DSec(DeepSeek Elastic Compute)的弹性计算平台,旨在解决 Agent 训练中的基础设施瓶颈。与普通大模型不同,Agent 训练需要频繁创建和销毁干净的沙盒环境。DSec 每秒可生成超 5000 个沙盒,单日达 300 万个。它提供函数调用、容器、轻量虚拟机和完整虚拟机四种后端,并通过统一的 Python SDK 调度。为了应对巨
人工智能初创公司Anthropic与医学知识平台OpenEvidence展开合作,将向约100个中低收入国家的医生提供OpenEvidence AI搜索工具的专业版本。该计划旨在利用人工智能改善医疗信息的获取。
Go.AI为银行等受监管组织提供本地部署的AI硬件设备和软件工具,近日完成由Updata Partners领投的8500万美元A轮融资。首席执行官David Moscatelli向Axios Pro证实了这一消息。
数字家居改造平台Angi Inc.任命Michael Steib为首席执行官,负责推动公司业务转型,并进一步加大对人工智能的关注。公告未披露具体的新人工智能产品或技术进展。
研究人员提出了ScriptMoE,这是一种覆盖10种文字体系、229种语言的场景文字识别模型。该模型采用共享视觉编码器和稀疏混合专家解码器,将每张图像路由至与其文字体系匹配的专家,同时通过共享专家学习跨文字体系知识。研究团队还构建了合成数据集TextMuSS-10M,以弥补许多语言训练数据不足的问题。ScriptMoE在TextMuSS-Bench上达到82.06%的准确率,比最强基线高1.31个
雷神(THUNDEROBOT)宣布即将推出 STATION 系列迷你 AI 工作站。该系列最高可选 AMD 锐龙 AI Max+ PRO 495 处理器,支持弹性集群组网,可灵活部署多台设备,并根据需求扩展算力。产品面向 AI 开发、专业创作和企业应用等场景。雷神近期已推出基于 Strix Halo 的 AI Master M7000 移动工作站,并计划推出采用 Strix Halo 或 Gorg
Anthropic 发布 Claude Code v2.1.280,并将 Claude Opus 5.5 正式设为默认 Opus 模型。该模型支持 100 万 Token 上下文窗口,输入价格为每百万 Token 4 美元,输出为 20 美元,缓存读取为 0.20 美元。Pro 和 Team Standard 套餐的默认模型也从 Sonnet 切换为 Opus。此次更新还修复了安全检查重试、MCP
研究人员提出 Segment-Snap,用于理解三维场景中的交互,并联合描述可移动部件、部件运动以及操作区域。该方法识别较大的部件表面和较小的把手,再利用几何先验与把手位置推断运动方式和铰链轴,无需训练运动回归器。在 Articulate3D 验证集上,在保持掩码和轴不变的情况下,把手引导使运动门控平均精度从 13.74% 提升至 40.98%。加入额外把手候选后,把手平均精度从 24.63% 提
该研究提出一种紧凑的几何原生潜在空间,用于连接感知与生成。几何原生自编码器(GAE)的潜在表示可同时解码外观、深度、相机参数和点图。在保持生成器和训练流程不变的受控对比中,使用 GAE 潜在表示提升了视觉质量和独立测量的三维一致性。FVD 在 RealEstate10K 上下降 12.7%,在 DL3DV 上下降 23.1%;RealEstate10K 上的相机轨迹误差则降低了一半。
HyperQ在冻结的掩码扩散语言模型中加入令牌条件量子残差分支。轻量级电路超网络针对每个令牌,为共享的稀疏量子电路生成专属参数,训练时只更新新增分支。由于所需期望值可以通过精确的经典表达式计算,该方法能够在11亿参数的骨干模型上训练16至64量子比特的电路。在下游基准测试中,随着电路宽度增加,平均分数从47.65提升至54.30。在64量子比特配置下,HyperQ比骨干模型高4.71分,比低秩适配
本综述将大型语言模型(LLM)在心理健康领域的发展概括为三个阶段:最初作为信息工具和模式识别器,随后成为用于即时互动的共情型对话者,目前则迈向具备持续记忆的长期个性化陪伴者。文章系统分析了相关核心技术,以及涵盖用户画像、记忆、推理和规划的智能体架构,并梳理数据集与评测基准。研究旨在整合这一领域较为分散的文献,为构建负责任、有效且以人为本的心理健康人工智能系统提供发展方向。
OpenRouter 核查了目录中的 37 个嵌入模型条目,并通过 28 项 API 检查测试了 19 个模型。指南建议英文 RAG 以低成本的 text-embedding-3-small 起步,长上下文场景选择 Voyage4-large,多语言开放权重方案则考虑 Qwen3-Embedding-8B。代码搜索可使用 voyage-code-4,文本与图像检索可选择 Gemini Embedd
火山引擎已为Seedance 2.5 API推出Draft模式。创作者可先以较低成本生成480P样片,检查场景、构图、主体动作、对白、音效和运镜节奏,再通过样片ID生成1080P成片。系统会延续提示词、参考素材以及seed、画面比例、时长等关键参数。官方以5秒1080P视频为例称,抽卡4次时成本可降低57%,抽卡20次时节省幅度可达77%。与先生成低分辨率视频再进行超分辨率处理不同,该模式直接生成