AI.ADK.WANG MODELS LAB
AI模型深度评测对比库 [2万页收录]
收录全球顶尖学术、开源和端侧大模型。提供 MMLU (综合知识)、HumanEval (代码手写)、GPQA (专家级物理/数学) 等标准化 benchmarks 的全能对比雷达。
已收录 AI 模型
24,820 款
标杆评测指标
68 个维度
深度技术评测
1,200 篇+
对比检索周均
1.4M 次
筛选结果:2 款模型
模型类型分类
DeepSeek-R1 旗舰推理模型
深度求索 (DeepSeek) MMLU: 90.8%DeepSeek-R1 旗舰推理模型 是推理大模型,提供 64000 Tokens 上下文窗口,采用 MIT 许可协议。
参数:
上下文:64,000 Tokens (64K)
开源协议:MIT
HumanEval
GPQA专家
1M API 价格
Claude 3.5 Sonnet
Anthropic MMLU:Claude 3.5 Sonnet 是全能旗舰模型,提供 200000 Tokens 上下文窗口,采用 商业闭源 许可协议。
参数:
上下文:200,000 Tokens (200K)
开源协议:商业闭源
HumanEval
93.7%
GPQA专家
1M API 价格