代码审查 场景推荐:Claude 3.5 Sonnet (2024-10-22)
代码审查 → Claude 3.5 Sonnet (2024-10-22)
场景概述
Claude 3.5 Sonnet (2024-10-22) 由 Anthropic 发布,是 代码审查 场景下的推荐选项之一。
推荐模型
| 排名 | 厂商 | 上下文窗口 | Score |
|---|---|---|---|
| #2 | Anthropic | 200K | 57/100 |
性能分析
基准测试表现
| 基准 | 得分 |
|---|---|
| MMLU | 87.2 |
| HUMANEVAL | 86.1 |
| GSM8K | 94.0 |
| MATH | 75.1 |
| BBH | 84.2 |
| GPQA | 50.9 |
优势
- MMLU 得分 87.2,知识推理能力强。
- HumanEval 86.1,代码生成能力出色。
- GSM8K 94.0,数学推理稳健。
- 上下文窗口 200K,支持长文本。
需求
- 需要 anthropic 的 API 密钥
- 输入长度须在 200K 上下文窗口内