核心规格
| 厂商 | xai |
|---|
| 版本 | 2 |
|---|
| 发布日期 | 2024-08-13 |
|---|
| 上下文窗口 | 131072 tokens |
|---|
| 输入模态 | text, image |
|---|
| 输出模态 | text |
|---|
| 许可 | Proprietary |
|---|
| 文档 | https://docs.x.ai/ |
|---|
基准测试表现
| 基准 | 得分 | 单位 | 评测日期 | 备注 | 来源 |
|---|
| MMLU | 87.5 | % | 2024-08-13 | 5-shot | 查看 |
| HUMANEVAL | 88.4 | pass@1 | 2024-08-13 | — | 查看 |
| GSM8K | 93.2 | % | 2024-08-13 | 0-shot CoT | 查看 |
| MATH | 76.8 | % | 2024-08-13 | 0-shot CoT | 查看 |
| BBH | 84 | % | 2024-08-13 | 3-shot CoT | 查看 |
定价
| 项目 | 价格 | 币种 |
|---|
| 输入 | $2 / Mtok | USD |
| 输出 | $10 / Mtok | USD |
| 缓存读 | $0 / Mtok | USD |
| 缓存写 | $0 / Mtok | USD |
数据来源:
https://x.ai/api
· 截至 2024-08-13
合规性
- 数据驻留: US
- SOC2: ✗
- HIPAA: ✗
- GDPR: ✗
- ISO 27001: ✗
Grok-2
模型概述
Grok-2 是 xAI 于 2024 年 8 月 13 日发布的旗舰模型。模型最大亮点是与 X(原 Twitter)平台的紧密集成,可对实时事件与热门话题保持感知——这是其他旗舰模型无法匹配的能力。Grok-2 接受文本与图像输入,支持 131K 上下文窗口,在学术基准上与 GPT-4o、Claude 3.5 Sonnet 同台竞争。MMLU 得分 87.5,接近 GPT-4o(88.7)与 Claude 3.5 Sonnet(88.7)。模型可通过 X 平台的 Grok 聊天机器人(Premium 订阅用户)与 xAI API 调用。Grok-2 还以相对宽松的内容策略著称,xAI 将其作为面向希望减少拒绝率用户的特点进行宣传。
核心规格
基准测试表现
| 基准 | 得分 | 单位 | 备注 |
|---|
| MMLU | 87.5 | % | 5-shot |
| HumanEval | 88.4 | pass@1 | — |
| GSM8K | 93.2 | % | 0-shot CoT |
| MATH | 76.8 | % | 0-shot CoT |
| BBH | 84.0 | % | 3-shot CoT |
定价
| 档位 | 价格(每百万 token) |
|---|
| 输入 | $2.00 |
| 输出 | $10.00 |
| 缓存读取 | $0.00 |
| 缓存写入 | $0.00 |
定价来源:https://x.ai/api (截至 2024-08-13)。
优势
- 通过 X 平台集成具备实时感知能力,旗舰中独有。
- 基准表现强劲,多数指标与 GPT-4o 竞争力相当。
- 支持文本与图像多模态输入。
- 内容策略相对宽松,拒绝率较低。
劣势
- 闭源专有模型,不支持自托管,企业合规认证有限。
- 不支持音频模态(不同于 GPT-4o)。
- 与 X 生态绑定较紧,部分企业采购方存在顾虑。
- 相较 OpenAI、Anthropic 等成熟厂商,市场经验尚浅。
适用场景
- 实时新闻与事件感知聊天机器人。
- 社交媒体内容生成与趋势分析。
- 时效性敏感的面向客户应用。
- 文本与图像结合的视觉问答。
参考文献