模型评测
大模型评测基准与排行榜(共收录 53 个工具)
AgentReady
— AgentReady 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
AGI-Eval
— AGI-Eval 大模型评测社区(
官网
)
AI Coding Compare
— AI Coding Compare 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Aider Polyglot Benchmark
— Aider 的多语言代码编辑基准,用真实编程题比较模型修改代码和通过测试的能力。(
官网
)
Algomax
— Algomax 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
ARC-AGI Leaderboard
— ARC Prize 的抽象推理排行榜,用新颖视觉任务衡量模型的泛化与组合推理能力。(
官网
)
Arize
— Arize 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
Artificial Analysis
— 独立大模型评测机构,性能、价格、速度全维度对比(
官网
)
Basemark
— Basemark 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Benchmarkemail
— 智能内容是由Benchmark email提供的人工智能电子邮件文案工具。(
官网
)
Berkeley Function-Calling Leaderboard
— 伯克利函数调用排行榜,评测模型选择工具、生成参数和处理复杂 API 的准确性。(
官网
)
C-Eval
— 全面的中文基础模型多学科评估套件(
官网
)
Censius
— Censius 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
Chatbot Arena Search
— 面向搜索任务的模型竞技场,通过匿名用户偏好比较不同 AI 搜索系统。(
官网
)
CMMLU
— 综合性的中文大模型多任务语言理解评测基准(
官网
)
Confident
— Confident 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
Epoch AI
— AI 发展趋势与算力研究机构,数据可视化丰富(
官网
)
Fiddler
— Fiddler 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
FlagEval
— 智源研究院推出的大模型评测平台(天秤)(
官网
)
GAIA Leaderboard
— GAIA 通用智能体基准排行榜,测试模型结合推理、网页浏览和工具使用解决问题。(
官网
)
H2O EvalGPT
— H2O.ai 推出的基于 Elo 评分的大模型评测工具(
官网
)
HELM
— 斯坦福大学推出的语言模型整体评估框架(
官网
)
Honeyhive
— Honeyhive 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
Humanity’s Last Exam
— 由专家编写的高难度跨学科基准,用于测试前沿模型在专业知识与推理上的极限。(
官网
)
LatticeFlow AI
— 瑞士 AI 模型评测平台,用于合规评估与模型风险排查。(
官网
)
LiveBench
— 无污染的大模型基准测试,题目持续更新(
官网
)
LLM Sandbox By Dioptra
— LLM Sandbox By Dioptra 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
LLM Stats
— LLM Stats 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
LLMEval3
— 复旦大学 NLP 实验室推出的大模型评测基准(
官网
)
LMArena
— AI 模型匿名对战评测平台,用户盲评投票生成大模型竞技场排行榜(
官网
)
LogicMonitor
— LogicMonitor 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
MagicArena
— 字节跳动推出的视觉生成模型竞技场(
官网
)
Manifest
— Manifest 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
MMBench
— 全方位的多模态大模型评测基准(
官网
)
MMLU
— 大规模多任务语言理解基准,覆盖 57 个学科(
官网
)
Open LLM Leaderboard
— Hugging Face 推出的开源大模型评测排行榜(
官网
)
OpenCompass
— 上海人工智能实验室推出的大模型开源开放评测体系(司南)(
官网
)
Opik
— Opik 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Phoenix
— Phoenix 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
PubMedQA
— 生物医学研究问答评测数据集(
官网
)
SEAL LLM Leaderboard
— SEAL LLM Leaderboard 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Stanford AI Index
— 斯坦福年度人工智能发展报告,系统追踪研究、产业、政策、教育和社会影响指标。(
官网
)
SuperCLUE
— 中文通用大模型综合性测评基准(
官网
)
SWE-bench
— AI 编程能力权威基准,真实 GitHub issue 修复测试(
官网
)
TensorZero
— TensorZero 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Terminal-Bench
— 评测 AI 智能体在真实终端环境中完成软件工程和命令行任务的基准。(
官网
)
TraceRoot AI
— TraceRoot AI 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Vellum LLM Leaderboard
— 持续汇总主流模型在质量、速度、上下文和价格等维度的对比数据。(
官网
)
ViralMoment
— ViralMoment 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(
官网
)
Whylabs AI Observatory
— Whylabs AI Observatory 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(
官网
)
τ-bench
— 评测工具型语言智能体在零售、航空等真实业务交互中完成任务的能力。(
官网
)
爱心理
— 一个创新的人工智能心理学评测服务平台,通过全面评估和精准筛查,为学校和企业提供了科学管理心理健康和人才的有效工具(
官网
)
采风问卷
— 采风问卷是一款全新体验的调查问卷,表单,评测等调研平台,有趣的交互方式,漂亮的作品,让客户更乐意回答,提升调研的回复率。(
官网
)