核心规格

厂商google
版本1.5-pro
发布日期2024-02-15
上下文窗口2e+06 tokens
输入模态text, image, audio, video
输出模态text
许可Proprietary
文档https://ai.google.dev/gemini-api/docs

基准测试表现

基准得分单位评测日期备注来源
MMLU85.9%2024-02-155-shot查看
HUMANEVAL71.9pass@12024-02-15查看
GSM8K91.7%2024-02-150-shot CoT查看
MATH58.5%2024-02-150-shot CoT查看
BBH84%2024-02-153-shot CoT查看

定价

项目价格币种
输入$1.25 / MtokUSD
输出$5 / MtokUSD
缓存读$0.3125 / MtokUSD
缓存写$1.25 / MtokUSD

数据来源: https://ai.google.dev/pricing · 截至 2024-08-01

合规性

  • 数据驻留: US
  • SOC2: ✓
  • HIPAA: ✗
  • GDPR: ✓
  • ISO 27001: ✓

Gemini 1.5 Pro

模型概述

Gemini 1.5 Pro 是 Google DeepMind 于 2024 年 2 月 15 日发布的旗舰多模态模型。其最大亮点是行业领先的 200 万 token 上下文窗口,可在单次调用中完成整个代码库推理、多小时视频理解与百万字文档分析。模型原生接受文本、图像、音频、视频四种输入,是唯一将视频作为一等模态处理的旗舰。Gemini 1.5 Pro 基于 MoE 架构,在多数基准上达到接近头部闭源旗舰的水平,价格约为 GPT-4o 的一半。它驱动 Gemini Advanced 消费产品、Google Cloud Vertex AI 以及 Google Workspace AI 功能。其长上下文能力对处理大型法律合同、财务报告或研究语料库的企业尤为关键。

核心规格

属性数值
厂商Google DeepMind
版本1.5-pro
发布日期2024-02-15
上下文窗口2,000,000 tokens
输入模态文本、图像、音频、视频
输出模态文本
许可证专有
文档地址https://ai.google.dev/gemini-api/docs

基准测试表现

基准得分单位备注
MMLU85.9%5-shot
HumanEval71.9pass@1
GSM8K91.7%0-shot CoT
MATH58.5%0-shot CoT
BBH84.0%3-shot CoT

定价

档位价格(每百万 token)
输入$1.25
输出$5.00
缓存读取$0.3125
缓存写入$1.25

定价来源:https://ai.google.dev/pricing (截至 2024-08-01)。

优势

  • 行业领先的 2M token 上下文窗口,可处理超长输入。
  • 原生视频模态支持,在旗舰模型中独树一帜。
  • 定价竞争力强,约为 GPT-4o 的一半。
  • 跨文本、图像、音频、视频的多模态理解稳健。

劣势

  • HumanEval 得分(71.9)在纯代码任务上落后于 GPT-4o 与 Claude 3.5 Sonnet。
  • 对输入深处事实的长上下文召回稳定性偶有波动。
  • 闭源专有模型,不支持自托管。

适用场景

  • 整代码库的重构与分析。
  • 长视频摘要与内容审核。
  • 多文档法律与财务研究。
  • 跨媒体归档的多模态检索。

参考文献