代码审查 场景推荐:Qwen2.5 72B
代码审查 → Qwen2.5 72B
场景概述
Qwen2.5 72B 由 Alibaba 发布,是 代码审查 场景下的推荐选项之一。
推荐模型
| 排名 | 厂商 | 上下文窗口 | Score |
|---|---|---|---|
| #7 | Alibaba | 131K | 37/100 |
性能分析
基准测试表现
| 基准 | 得分 |
|---|---|
| MMLU | 86.1 |
| HUMANEVAL | 86.6 |
| GSM8K | 88.4 |
| MATH | 83.1 |
| BBH | 82.4 |
优势
- MMLU 得分 86.1,知识推理能力强。
- HumanEval 86.6,代码生成能力出色。
- GSM8K 88.4,数学推理稳健。
需求
- 需要 alibaba 的 API 密钥
- 输入长度须在 131K 上下文窗口内