意图胜过表面:超越响应模仿的可控用户模拟
用户模拟器为训练和评估交互式助手提供了可扩展的环境。新方法UserIDA将下一轮用户发言应实现的局部交互意图,与表达该意图的语言形式分离开来。该方法采用六类意图接口、监督式微调,以及基于群组强化学习的意图校准策略优化。在LMSYS-USP上,UserIDA的意图准确率达到86.6%,比最强的专用基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的对话状态中实
AI 新闻中心 过去30天分析了 1964 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
用户模拟器为训练和评估交互式助手提供了可扩展的环境。新方法UserIDA将下一轮用户发言应实现的局部交互意图,与表达该意图的语言形式分离开来。该方法采用六类意图接口、监督式微调,以及基于群组强化学习的意图校准策略优化。在LMSYS-USP上,UserIDA的意图准确率达到86.6%,比最强的专用基线高出24.3个百分点,同时提升了语义和风格相似度。在上下文内干预测试中,它在91.7%的对话状态中实
据彭博社援引知情人士报道,人工智能公司 Anthropic 已与比特币挖矿企业 Riot Platforms 签署一项为期 20 年、价值 91 亿美元的算力协议。Riot 将从其位于美国得克萨斯州罗克代尔的数据中心园区提供 191 兆瓦算力。协议包含两次、每次 5 年的续约选择权,若全部执行,合同总销售额最高可达 161 亿美元。该交易显示,随着 AI 服务需求持续增长,Anthropic 正加
该技术报告介绍了 Motif 3,一款采用纯解码器 Mixture-of-Experts 架构的语言模型,总参数量为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择其中 8 个。模型采用分组差分潜在注意力等技术,旨在提升训练稳定性、专家专业化程度和推理效率。Motif 3 使用约 12.5 万亿个 token 进行预训练,
Sci-VBench是一项用于评估科学视频生成模型的基准测试,重点考察需要知识和推理的任务。该数据集包含1,253个由专家标注的样例,覆盖自然科学、医疗、人文与社会科学、工程四大领域的60个主题。评估不仅关注视觉逼真度,还衡量提示词遵循度、科学正确性和因果正确性。对16个闭源和开源模型的测试显示,各系统的自动感知质量分数较为接近,但在科学推理和因果准确性方面存在显著差异,闭源模型与开源模型之间也出
SWE-Bench ProMax 是一个由专家策划的基准测试,包含从真实提交中选取的 170 个代码重构任务,覆盖 Python、Java、TypeScript、Go、C、C++ 和 Rust 七种语言。该项目针对现有基准中的测试缺陷,以及模型可能从训练数据中逐字复现标准补丁等问题进行了改进。每个任务平均修改 11.4 个文件和 261.6 行代码,规模明显超过现有评测。在两种代理框架的实验中,最
Macaron-V1 是一个开放式智能体模型系列,旨在从真实环境中的经验学习,并在部署后持续适应。其架构冻结基础模型,组合用于聊天、智能体任务、编程和 GenUI 的专用 LoRA 适配器,并在每轮用户交互中选择一个适配器。旗舰版本 Macaron-V1-Venti 使用 7440 亿参数的 GLM-5.2 基础模型;基于 500 亿参数 Qwen3.6 的 Macaron-V1-Tall 则面向
无线集团有限公司(TVB)宣布与基汇资本关联公司Triton Square Limited签署协议纲领,计划在香港成立合资公司,提供先进AI算力服务。合资公司普通投票权股份预计由TVB持有51%、基汇资本持有49%。项目将在TVB将军澳工业邨园区内建设并运营GPU、CPU等算力设施,向外部客户及集团成员公司提供服务。资金来源包括基汇资本最高20亿港元的股本投资、银行融资和集团内部资源。首阶段目标算
Anthropic正在为Claude部署双层标记机制:在文本中嵌入人眼不可见的水印,并为生成的SVG、PNG、JPG等文件附加符合C2PA标准的数字签名元数据。该机制自8月2日起应用于新发布的Claude模型,并在全球所有Claude产品中生效,不局限于欧盟。通过AWS、Google Cloud和Microsoft Foundry调用Claude生成的文本同样会带有水印,但文件元数据是否存在取决于
英伟达研究团队提出了一种在不同语言模型之间迁移KV缓存的方法,使目标模型能够跳过计算量较大的预填充阶段。根据模型和上下文的复杂程度,缓存转换速度据称比重新处理整个上下文快2.7至25倍。这项技术有望降低长对话和长文档场景下的推理延迟与成本,尤其是在切换或升级模型时。不过,其实际影响仍取决于模型之间的兼容性,以及能否在生产环境中得到广泛部署。
SPOT是一种改进在策略蒸馏的方法。在该方法中,学生模型在教师模型的监督下,根据自身生成的轨迹进行学习。SPOT结合教师模型的熵、少量高概率候选覆盖的概率质量,以及学生与教师之间的不匹配程度,选择有限预算下需要探测的位置。随后,它通过验证器对学生模型生成的后续轨迹进行评分,评估教师提出的候选。基于这些结果,SPOT构建带有KL正则化的训练目标,在保持教师分布约束的同时,偏向下游结果更好的候选。在多
据 LinkedIn 资料,曾负责 OpenAI 机器人项目、并在苹果参与 Mac Pro 和 MacBook Air 开发的 Caitlin Kalinowski 已加入 Anthropic,担任技术人员并从事研究。这一任命表明 Anthropic 可能正在探索机器人和实体 AI。与此同时,OpenAI 仍在招聘硬件、运营、系统和机器学习工程师,计划先开发协助技术工人的机器人,长期则面向个人用户
Anthropic 宣布,6 月底推出的 Claude Sonnet 5 将永久维持首发促销价格,原定于 9 月 1 日恢复的标准价格已取消。API 价格将继续维持输入每百万 Token 2 美元、输出每百万 Token 10 美元,而此前计划的价格为 3 美元和 15 美元。Claude Sonnet 5 拥有 100 万 Token 的上下文窗口。Anthropic 表示,该模型在推理、工具使
有网友称,DeepSeek在深度思考模式下会给用户取“墨墨”等内部外号。对此,AI回应称,这只是推理过程中为问题临时添加的上下文标签,用于梳理回答重点,例如判断用户喜欢深入追问。AI表示,这些标签不会被存储或记忆,也不带有嘲讽或贬义。IT之家提醒,相关解释来自AI自身,并非DeepSeek工作人员的正式回应。
腾讯开源了 BrowserSkill,一款专为 AI 智能体设计的浏览器自动化工具。它支持复用用户已有的浏览器登录状态,并在独立窗口中执行任务,从而减少重复验证,也不影响用户当前的浏览或沟通。BrowserSkill 提供 bsk 命令行接口,计划兼容 Claude Code、Codex 以及腾讯 Workbuddy 等智能体。演示场景包括搜索和总结网络内容、分析高互动评论等。该工具采用 CLI
据报道,人工智能公司Anthropic已与正从比特币挖矿转向云计算和AI数据中心服务的Riot Platforms签署一项为期20年、总价值最高达91亿美元的协议。Riot将通过其位于得克萨斯州罗克代尔的园区,为Anthropic的大规模模型运营提供191兆瓦的电力容量。这项合作凸显了AI模型开发商对稳定计算基础设施的竞争日益加剧,也反映出传统加密货币挖矿设施被改造为AI数据中心的趋势。部分信息来