Epsilon Health完成AlleyCorp领投的2000万美元A轮融资,结束隐身运营
人工智能放射科医疗公司Epsilon Health宣布结束隐身运营,并完成由AlleyCorp领投的2000万美元A轮融资。该公司与使用其AI更快生成医学影像报告的放射科医生签订合作协议。
AI 新闻中心 过去一年分析了 8100 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
人工智能放射科医疗公司Epsilon Health宣布结束隐身运营,并完成由AlleyCorp领投的2000万美元A轮融资。该公司与使用其AI更快生成医学影像报告的放射科医生签订合作协议。
该研究探讨如何让大语言模型生成不仅能发现问题,还能指导作者进行具体修改的同行评审。ActReview将任务拆分为问题诊断和修改建议生成。研究人员利用OpenReview上的真实评审与反驳讨论,构建ActReview-40K数据集,将评审者提出的问题与作者回应及论文中的证据对应起来。Qwen3-8B-Base先经过监督微调,再使用GRPO和针对具体问题的评分类别奖励进行后训练。研究还推出了由人工整理
该研究分析图像标记器如何影响统一自回归多模态模型对图像和文本标记的联合建模。研究人员在多模态持续预训练过程中,跟踪文本、图像、文本到图像以及图像到文本预测的任务特定验证损失。结果表明,不同任务的损失呈现不同的扩展规律,并会对标记器产生不同的排序。基于共享文本词表计算的图像到文本损失,在跨标记器评估生成质量和视觉理解能力时,比文本到图像损失提供了更一致的信号。更好的图像重建能力并不一定带来更低的任务
IdeaAMBIG评估研究方法规范是否包含足够信息,使具备能力的实施者或编程代理无需无依据的假设,就能构建出预期方法。该基准包含660个有证据支持的实例:163个来自可复现性报告和GitHub问题的真实缺口,以及497个注入可实现参考资料中的受控合成缺口。研究评估三项能力:判断规范是否适合编码、定位缺陷,以及生成澄清行动。在测试的13个大语言模型中,最佳模型在真实实例上的宏观缺陷恢复率仅为9.6%
一项研究探讨了如何让推理模型持续使用用户提示所采用的语言进行推理,而不是主要依赖英语。研究团队构建了拥有33.5亿参数的 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六项基准测试中,实现了覆盖60种语言、超过93%的语言内推理率。研究表明,更广泛的语言覆盖、多语言非推理数据,以及足够强的英语推理基础,有助于将能力泛化到未参与训练的语言。研究团队将公
一项研究分析了多模态实体链接系统在稀有实体上表现下降的原因。研究不只依赖页面浏览量等流行度指标,还采用知识图谱结构指标,识别文档记录不足或连接较弱的实体。根据稀有性的不同定义,当前最先进系统的准确率下降了15.4%至39.9%。研究人员提出了一种无需训练的框架,让具备推理能力的视觉语言模型反复搜索维基百科并动态收集证据。单独使用推理对稀有实体的提升并不明显;单独使用检索虽然能提高稀有实体准确率,却
MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为
神经符号系统依赖数学求解器来验证推理,但求解器无法判断形式翻译是否与指定的参考形式化保持严格等价。该研究将一种失效模式定义为“保留判定的不忠实性”(VPU):错误编码仍能成功执行,并产生预期判定。理论分析表明,仅依赖结构和判定结果的验证方法,检测这类案例的能力最多接近随机水平。研究人员提出 Generative Verification(GenV),将离线的 Z3 等价性预言器蒸馏为连续且无需参考
一项研究分析了晚交互方法用于视觉文档搜索时的存储成本。现有压缩方法通常保留每页约1,000个向量中的一部分,或使用局部平均值,但在严格的存储限制下性能会明显下降;其他方案则需要重新训练编码器。研究人员对三种编码器进行分析后发现,这些向量位于单位球面上,并集中在内在维度仅为5到6的流形附近。将k-means质心归一化到球面表面,可以修正MaxSim分数被系统性低估的问题;与未处理的质心相比,nDCG
该研究提出 DRG-MAPPO,一种用于协同空战决策的多智能体强化学习框架。该方法通过图结构和图注意力机制,建模友军、敌军与威胁之间随时间变化的关系。分层策略动态分配“领导者”和“支援者”等战术角色,低层策略则根据角色信息和关系特征选择离散机动动作。此外,研究设计了目标优先级辅助任务,以促进集中火力等协同行为。在实验中,作者报告了 87% 的胜率。不过,这些结果仅限于所测试的仿真环境,尚不能证明该
UniH³是一种使用单一模型处理多种医学影像模态和退化类型的复原框架。该方法通过层次化同质性记忆模块和同质性引导注意力机制,利用不同模态之间共享的解剖结构。同时,层次化异质性平衡器可减少多任务优化过程中的任务冲突。在MedIR-2D-500K和MedIR-3D-3K基准测试中,研究人员报告称,该方法在全能复原和单任务复原方面均取得了当前最佳水平的结果。代码已公开。
研究人员提出了“负向自蒸馏”(NSD),用于提升大语言模型在复杂推理任务中的表现。该方法针对策略内自蒸馏(OPSD)的一项缺陷:模型可能模仿利用特权信息生成的、过度自信的推理轨迹,从而抑制不确定性表达、探索和自我纠错。NSD不要求模型模仿正确答案,而是让模型偏离由自身生成的、针对具体问题的负向条件,例如“粗心推理者”的行为。研究人员还设计了动态门控机制,自动识别推理关键词元,使梯度更新只针对行为缺
陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主发表联合声明,警告AI公司与数学界之间正出现日益严重的目标错位。声明承认,大语言模型近几个月在解决困难数学问题方面进步明显,但将数学问题主要用作基准测试,可能损害概念理解、严谨写作、成果署名以及人与人之间的知识传承。声明指出,解题只是实现理解和洞察的手段,并非数学研究的最终目的。大量生成且未经充分验证的答案还可能破坏研究环境,引发抄袭和署名争议。AI有
总部位于纽约的金融科技公司Luminary完成了由Ten Coves Capital领投的2200万美元A轮融资。该公司成立于2022年,开发用于遗产规划和财富传承管理的AI工作流工具。目前,Luminary支持的客户资产总额已超过5000亿美元,并计划进一步扩展AI能力和商业团队。
一辆特斯拉 Model Y 在曼哈顿撞上人行道防护棚、公交站牌和脚手架,导致一名 27 岁女乘客死亡。警方称,司机血液酒精浓度为 0.229%,远高于纽约州法定上限;车内两人均未系安全带。司机已被控车辆过失杀人、酒后驾驶和肇事逃逸等罪名。特斯拉 CEO 埃隆·马斯克否认车辆或 Autopilot 与事故有关,并批评 ABC News 的报道。纽约市警察局目前没有将事故归因于 Autopilot 或