PACE:发现用户请求中的隐藏冲突
该研究推出了 PACE 数据集,用于评估个性化助手能否判断一个看似合理的请求是否与用户的实际情况相冲突。不同于主要关注执行指令的既有研究,PACE 要求模型从知识库中检索与用户相关的隐含事实,并结合请求识别潜在限制。研究人员还提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤来获取具有决定性的上下文证据。实验结果显示,PaceMaker 在证据检索质量和冲突判断准确率方面
AI 新闻中心 过去一年分析了 1518 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究推出了 PACE 数据集,用于评估个性化助手能否判断一个看似合理的请求是否与用户的实际情况相冲突。不同于主要关注执行指令的既有研究,PACE 要求模型从知识库中检索与用户相关的隐含事实,并结合请求识别潜在限制。研究人员还提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤来获取具有决定性的上下文证据。实验结果显示,PaceMaker 在证据检索质量和冲突判断准确率方面
餐厅经营者可能会把生成式 AI 当作快速美化菜单的捷径。但顾客往往能直觉察觉,菜品或其呈现方式似乎有些不对劲。
总部位于西雅图的初创公司Resect AI正在开发开源技术,旨在于人工智能系统产生幻觉之前进行检测。该公司由一支拥有人工智能领域经验的团队领导,并已从私募股权投资者处获得2500万美元融资,正式结束隐身开发阶段。
基准测试机构Vals AI的一项分析显示,使用开放权重模型执行构建网页应用等多阶段任务时,所需能源或用水量可能达到简单查询的1万倍。研究表明,人工智能的环境影响会随着任务复杂度和与模型交互次数的增加而显著上升。
据报道,OpenAI推出了GPT-6 Astra,具备105万token上下文窗口、多档推理强度,以及通过屏幕、键盘和鼠标直接操作图形用户界面的能力。文章宣称,Astra在数学、科学、软件工程和GUI操作基准测试中取得极高成绩;标准价格为每百万输入token 10美元、每百万输出token 50美元。产品据称将先向少数企业合作伙伴开放,随后逐步推送给ChatGPT会员和API用户。OpenAI表示
微软在 Copilot Studio 中新增了一项功能,允许开发者要求 AI 代理及其使用的特定工具必须经过人工审批。当代理尝试发送电子邮件、关闭客服工单或处理财务付款等敏感操作时,系统会暂停执行。用户可以查看代理的操作意图,并选择批准、允许当前会话继续或拒绝操作。该要求独立于代理的内置指令,即使代理判断某项操作是最佳下一步,也无法绕过人工授权。审批请求会直接显示在 Microsoft Teams
据 NeoWin 报道,微软计划从 9 月开始推送 Copilot Studio 更新。开发者将可以要求 AI 智能体在调用特定工具前先获得人工批准。启用审批后,工具调用会暂停,并显示智能体的操作意图,供用户审核。微软列举的适用场景包括发送电子邮件、关闭工单和处理付款。只要相关操作被设置为需要审批,AI 智能体就无法自行继续执行。
据 Downdetector,ChatGPT、Claude、Grok 和 Cursor 等多项主流 AI 服务曾同时出现大范围故障,持续近 4 小时,随后恢复正常。OpenAI 还发布 GPT-6 Astra,宣称这是其目前最强的大语言模型,并首次达到网络安全能力的“关键”门槛。不过,相关性能以及模型可监控性下降的说法尚未得到独立验证。英伟达 CEO 黄仁勋否认 AI 会消灭所有工作。演员戚薇则宣
法国 ISC 巴黎商学院的一项小型研究显示,过度依赖 ChatGPT 等 AI 产品,可能与独立思考能力下降、注意力持续时间缩短、记忆力减弱、自我怀疑增加以及部分情况下的社交孤立有关。研究人员访谈了 45 名年龄在 18 至 25 岁、每天使用 ChatGPT 的人士。部分受访者表示,ChatGPT 无法使用时会感到焦虑,也越来越倾向于先与聊天机器人交流,而不是向朋友、老师或同事求助。研究团队将这
ValueEdge Advisors主席内尔·米诺表示,在公司治理方面,Anthropic正朝着与SpaceX相反的方向发展。不过,她认为Anthropic的组织架构仍然罕见,并可能存在问题。这家人工智能公司采用公益公司框架,结合了上市公司和非营利组织的部分特征。米诺称,该架构既考虑股东价值,又不把股东价值作为唯一目标。她在彭博节目《The Close》中接受了罗曼·博斯蒂克的采访。
GPT-6 Astra 被介绍为该提供商目前广泛部署的能力最强模型。根据安全概览,它是该公司首个在其 Preparedness Framework 中,将网络安全能力评定为“关键”级别的模型。
Abliteration.AI 正在开发工具,让用户更容易访问未配备内置安全机制的强大人工智能模型。该公司认为,让防御方拥有与恶意行为者相同的能力,最终可能有助于提升网络安全。不过,这种做法也引发了关于滥用、责任归属以及移除安全控制措施的重大担忧。
OpenAI声称,其下一款大型模型GPT-6 Astra已经推出,并在网络安全、专业工作、软件工程、科学和计算机操作等领域实现“代际能力跃升”。该公司还表示,这是首个达到其“关键网络安全能力门槛”的模型。提供的描述并不完整,也没有给出支持AGI说法的独立可验证技术证据。
面向家庭的AI助手Ollie希望获取用户日常生活中的详细信息。不过,公司表示不会使用这些数据训练AI模型,也不会与第三方共享。
文章呼吁为日益自主化的医疗系统制定路线图,并以电影《极乐空间》为例:富裕精英能够获得先进医疗服务,而大多数人仍在地球上艰难求生。这个故事凸显出一种担忧:如果缺乏对医疗可及性、监管和责任的明确安排,人工智能医疗可能会加剧现有不平等。