AI 新闻中心

AI 新闻中心 过去一年分析了 4096 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

RecreationWorld:为混合计算机使用代理提供可扩展、可验证的环境

RecreationWorld是一套面向混合计算机使用代理的研究与评测框架,支持代理结合图形界面操作、软件开发和命令行工具。在Ubuntu、macOS、Windows、Android和Web环境中,代理需要研究正在运行的参考应用,并在没有预设流程的情况下构建忠实实现。统一测试系统同时评估程序结果和视觉结果。配套的RecreationBench包含跨领域、跨平台的250项任务。GPT-6 Astra

GraphSkillEvo:图结构智能体技能的进化优化

GraphSkillEvo是一种优化大语言模型智能体技能的方法。它不再将技能表示为缺乏结构的自然语言指令,而是将其建模为有向图:节点包含执行步骤和操作指导,边表示依赖上下文的步骤转换。该方法采用基于种群的进化过程,通过变异和交叉同时探索多个候选技能。在五项智能体基准测试中,作者报告称,与SkillOpt相比,GraphSkillEvo在GPT-5.4-nano上的平均准确率提高了4.01个百分点,

无需显式轨迹,让3D扩散策略学习前瞻能力

一种名为Movement Trend Guidance的方法,让3D扩散策略学习表示机器人交互未来演变方式的紧凑潜在表征。训练时,模型使用少量未来夹爪状态监督该表征;推理时,仅保留潜在变量,并将其与当前观测一起作为面向未来的条件输入。该方法仅使DP3的参数量增加3.52%,同时保留原有的密集动作生成和滚动时域设计。在RoboTwin2.0、LIBERO-40以及五项真实机器人任务上,性能均有所提升

Gemini Notebook推出返校更新:讲座录音、AI复习与60秒视频一站完成

谷歌为原名NotebookLM的Gemini Notebook新增多项学生功能。iOS和Android应用现在可以录制讲座或想法,自动生成转录内容,并与用户上传的参考资料一起保存。互动式学习概览可将原始资料整理为复习指南、摘要、思维导图、测验和记忆卡片。短视频概览通过教育动画和语音讲解,在60秒内解释公式及复杂概念,支持80多种语言。考试准备工具新增简答题、选择题和填空题。18岁以上用户可在移动设

微软 Copilot 桌面版新增内置浏览器,支持多标签和全屏浏览

微软正在 Windows 和 macOS 版 Copilot 桌面应用中测试内置并排浏览器。用户可以直接在 Copilot 对话旁打开网页,使用多个标签页并切换到全屏模式。目前该功能面向管理员测试,需要通过设备管理策略 BrowsingEnabled 启用,预计 11 月底开始更广泛地自动推送。后续更新还将为侧边栏网页标签增加右键菜单,支持将链接直接在外部浏览器中打开。浏览历史、Cookie 和自

ZCode 道歉并开源:阿里云 OSS 存储桶已清空,Repo Wiki 功能下线

针对社区反馈的产品安全问题,ZCode 团队已在 GitHub 开源代码,并邀请中国信息通信研究院和绿盟科技开展安全审计。团队表示从未留存用户代码或数据,也未将其用于模型训练。客户端 v3.14.0 已移除 Repo Wiki 功能,并切断本地仓库快照的生成与上传链路。绿盟科技审查后确认,未发现可触发快照生成或文件外发的功能路径。技术评测还确认,阿里云 OSS 的 zcode-prod 存储桶已无

Rokid 将于 9 月 24 日发布新一代 AI 眼镜

Rokid 宣布,新一代 AI 眼镜将于 9 月 24 日 14:00 在中国杭州举行的第五届全球数字贸易博览会上发布。产品口号为“Less tool. More human”,中文表述为“不是工具,是感官的延伸”。初代 Rokid AI 眼镜搭载高通 AR1 SoC,采用 Micro LED 与衍射光波导组成的双目显示方案,分辨率为 480×640,亮度为 1500 尼特,视场角为 30 度。此

腾讯推出“混元智囊团”专家平台,AI竞争转向外部人才生态

腾讯为混元大模型推出面向外部专业人士的“混元智囊团”平台,招募金融、法律、医疗、编程、设计、翻译和文学等十多个领域的专家。专家以远程接单、按任务付费的方式,参与数据集制作、专业内容编写、知识审核和模型优化。平台设置动态评级机制,为高等级专家提供更高难度、更高单价的任务,并发放腾讯官方认证证书。字节跳动此前已推出类似的 Xpert 专家社区,为豆包模型提供专业数据支持。两家企业的布局表明,中国大型科

中国发布首款藏语多语言多模态AI输入法

中国发布“智达AI输入法”,据介绍,这是中国首款藏语多语言多模态AI输入法。该产品由藏语智能国家重点实验室研发,支持手机、电脑等终端,提供文字、语音和图像输入。功能包括符合国家标准的藏文键盘布局、藏文拉丁转写、卫藏、安多和康巴三大方言区的语音输入,以及中藏英混合语音输入。OCR功能可通过照片或截图识别混合文字,词库覆盖教育、法律、文学等23个学科,并可同步用户的词汇和输入习惯。研发团队还发布了配套

Figure AI首席执行官布雷特·阿德科克:“我们正在打造一个新物种”

Figure AI创始人兼首席执行官布雷特·阿德科克表示,公司正在开发人形机器人,目标是用人工智能驱动的机器取代体力劳动。这一表态体现了对所谓实体人工智能的雄心愿景,但没有提供新的技术证据或具体部署成果。人形机器人若被广泛采用,社会和劳动力市场是否已经做好准备,仍是一个有待回答的问题。