Benchmark Radar:面向 AI 基准测试与评估的持续更新数据库和搜索引擎
Benchmark Radar 是一个持续更新的数据库和搜索引擎,用于查找和评估大型语言模型及其他 AI 系统。平台覆盖语言模型评估、智能体与工具使用、编程、推理、安全以及特定领域评估。系统每天发现论文、代码仓库、数据集和发布内容,并将其与来源、引用、模型卡、技术报告及历史得分关联,方便用户核查评估证据。目录目前包含 1,283 条来源记录,以及覆盖 790 条记录的 12,916 个数值观测。项目还发布了网页仪表板、基准排行榜、帕累托前沿和趋势视图、可下载证据、每日信息流、可复现分析,以及支持离线查询的命令行界面。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。