构建面向生产环境的希腊语—英语语音识别系统
一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率
AI 新闻中心 过去30天分析了 2441 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率
微信员工就正在小范围内测的AI助手“小微”回应了隐私疑虑。小微支持通过文字或语音查询天气、查快递、点外卖,也可在朋友圈、公众号、聊天和视频号等场景中总结内容。微信方面表示,小微能接触的信息不会超出用户本人有权查看的范围。在聊天场景中,只有用户主动发起“问小微”并指定聊天内容时,微信客户端才会在本地临时读取并分析相关记录,原始聊天记录不会被保存。对于“小微会直接读取聊天记录”“偷看所有隐私”等说法,
在联发科2026年旗舰产品发布会上,联发科技董事兼首席运营官陈冠州表示,生成式AI和所谓的Token经济将影响下一代芯片的发展。随着AI从云端扩展到智能手机等终端设备,端侧AI预计将成为重要发展方向。陈冠州预测,到2030年全球Token消耗量可能增长超过24倍,达到每月约120,000万亿个Token。相关数据属于公司预测,尚未经过独立验证。
AlayaVista是一种可由摄像机控制的流式视频世界模型,旨在保持广泛的场景上下文,同时生成高保真的透视视图。系统从单张透视图像出发,利用预训练的全景扩展模型构建360度场景先验,并将其作为受摄像机条件控制的全景潜在状态持续演化。潜在视口渲染器将该状态转换为指定视角的视频潜在表示,透视细化模块则负责恢复细节、抑制伪影并进行超分辨率。为实现高效流式生成,研究团队将全景生成改造为分块自回归生成,并将
一名 Reddit 网友表示,他使用阿里巴巴开源的 Qwen3.8-27B 模型,在一张超频 RTX 3090 上耗时约 5 小时,开发出一款可玩的第一人称僵尸射击游戏。测试采用 Q4KM 量化版本和两套 Harness 方案,并通过 MSI Afterburner 对显卡进行超频,据称性能提升约 12%。Q4KM 通常指 GGUF 格式中的 4 位混合量化档位。这一项目展示了模型在本地编程场景中
DeepSeek 已在官方仓库主分支中加入 DeepSeek Harness 完整的桌面端目录。该应用预计支持 Apple Silicon 和 Intel Mac,以及 Windows x64,暂不支持 Linux。安装包预计将通过 download.deepseek.com 提供,但目前尚未发布可下载版本。与许多社区开发的客户端不同,官方版本使用自定义的 dsh-app:// 协议,而不是本地端
盖茨基金会宣布,未来两年至少投入10亿美元,推动AI及相关解决方案更广泛、公平地惠及全球人群。资金约40%用于教育,开发AI辅导工具和教学应用;约40%用于健康,支持诊断、临床决策、孕产妇和新生儿健康,以及新药和疫苗研发。农业和数字基础设施各获约10%,包括建设当前AI支持不足的语言数据集。基金会表示,应由当地社区参与决定数据的存储、共享和治理方式,并加强人才培养与技术可及性,让医生、农民、教师和
据报道,字节跳动计划于9月推出独立智能云存储服务“ADrive”。该企业级产品由火山引擎打造,面向AI智能体与人类用户协同办公,整合文件存储、团队协作和AI工具。其功能包括自然语言语义搜索、以图搜图、文档摘要、内容润色与改写、多语言翻译、多文档问答、OCR及文件格式转换。ADrive还支持在线编辑、版本历史、访问权限管理、限时分享和完整操作日志。服务预计采用按月或按年订阅模式,并针对不同规模的企业
据《The Information》报道,英伟达、Palantir 和 Booz Allen Hamilton 等企业客户因担忧专有数据的处理方式,正在限制使用 Anthropic 和 OpenAI 的前沿模型。英伟达据称仅将 Anthropic 模型用于开源软件开发等敏感度较低的任务,并把最机密的业务交给自家的 Nemotron 模型。Anthropic 允许为检测滥用而保留客户数据 30 天的
RSIAgent是一种无需额外训练的多智能体框架,能够自主探索陌生的数字环境,并将环境特定知识保存到可复用的记忆中。课程、执行和验证智能体先进行广泛探索,再针对困难案例、隐藏约束、边界条件和因果关系开展深入探索。生成的记忆无需更新模型参数即可用于后续任务。研究在OSWorld-v2和Agent’s Last Exam上的实验中报告称,该方法显著提升了开源模型的表现,并声称Kimi-K3和GLM-5
MacStories 主编 Federico Viticci 汇总了 iOS/iPadOS 27 的 54 项隐藏或不易发现的新功能。据介绍,本次更新没有延续大幅视觉改版路线,而是重点提升性能、可靠性并打磨细节。AI 功能是主要变化之一:Siri 可理解屏幕内容和上下文,跨 App 执行操作,分析图片,改写文字并搜索邮件;照片、文件、Safari 和快捷指令也加入 AI 辅助功能。其他更新包括改进
总部位于罗马的 Exein 在由 Headline 领投的一轮融资中筹集了 2.7 亿美元,公司估值达到 17 亿美元。Exein 为汽车、家用路由器等联网设备提供网络安全工具,并正在开发一种基础模型,旨在保护从机器人到灯泡在内的数十亿台互联网连接设备。
研究人员提出“Agent as Policy”(AGP),一种让通用人工智能代理在任务执行过程中直接控制实体机器人的方法,无需针对特定任务或环境进行训练。代理根据任务和机器人接口解读视觉信息,编写可执行程序,发出运动指令,并根据实际物理结果调整行动。AGP在多项真实世界操作任务中接受测试,包括根据人类视频进行装配、依据目标图像搭建积木、重新调整骰子方向、定向投掷以及双手折叠毛巾。在三种积木搭建配置
Realtime-Venus是一套面向音频和视频交互的主动式全双工系统,由两个分别训练、各含90亿参数的模型组成:用于视听交互的Realtime-Venus-Omni,以及用于语音交互的Realtime-Venus-Audio。两款模型通过共享因果时间线,整合连续感知、对话控制和原生语音生成。双循环运行环境可在对话持续进行的同时,异步执行后台推理和工具调用。根据公布的评测结果,Omni在8项视频基
盖茨基金会计划在未来两年投入10亿美元发展人工智能,重点是让贫困地区也能获得技术红利。比尔·盖茨在采访中高度评价中国人工智能的发展,称中国和美国各自都有至少四家机构的大模型能够保持最先进水平,但没有透露具体名称。他认为,开源模型对发展中国家尤其重要,并建议技术领先国家拿出数据中心5%的算力,作为数字援助免费提供给贫困国家。盖茨还讨论了数据中心排放、硬件价格上涨、AI对就业的影响以及社会不平等。他表