Key Specifications
| Vendor | xai |
|---|
| Version | 2 |
|---|
| Release Date | 2024-08-13 |
|---|
| Context Window | 131072 tokens |
|---|
| Input Modalities | text, image |
|---|
| Output Modalities | text |
|---|
| License | Proprietary |
|---|
| Documentation | https://docs.x.ai/ |
|---|
Benchmark Performance
| Benchmark | Score | Unit | Evaluated At | Notes | Source |
|---|
| MMLU | 87.5 | % | 2024-08-13 | 5-shot | view |
| HUMANEVAL | 88.4 | pass@1 | 2024-08-13 | — | view |
| GSM8K | 93.2 | % | 2024-08-13 | 0-shot CoT | view |
| MATH | 76.8 | % | 2024-08-13 | 0-shot CoT | view |
| BBH | 84 | % | 2024-08-13 | 3-shot CoT | view |
Pricing
| Tier | Price | Currency |
|---|
| Input | $2 / Mtok | USD |
| Output | $10 / Mtok | USD |
| Cache Read | $0 / Mtok | USD |
| Cache Write | $0 / Mtok | USD |
Source:
https://x.ai/api
· as of 2024-08-13
Compliance
- Data Residency: US
- SOC2: ✗
- HIPAA: ✗
- GDPR: ✗
- ISO 27001: ✗
Grok-2
模型概述
Grok-2 是 xAI 于 2024 年 8 月 13 日发布的旗舰模型。模型最大亮点是与 X(原 Twitter)平台的紧密集成,可对实时事件与热门话题保持感知——这是其他旗舰模型无法匹配的能力。Grok-2 接受文本与图像输入,支持 131K 上下文窗口,在学术基准上与 GPT-4o、Claude 3.5 Sonnet 同台竞争。MMLU 得分 87.5,接近 GPT-4o(88.7)与 Claude 3.5 Sonnet(88.7)。模型可通过 X 平台的 Grok 聊天机器人(Premium 订阅用户)与 xAI API 调用。Grok-2 还以相对宽松的内容策略著称,xAI 将其作为面向希望减少拒绝率用户的特点进行宣传。
核心规格
基准测试表现
| 基准 | 得分 | 单位 | 备注 |
|---|
| MMLU | 87.5 | % | 5-shot |
| HumanEval | 88.4 | pass@1 | — |
| GSM8K | 93.2 | % | 0-shot CoT |
| MATH | 76.8 | % | 0-shot CoT |
| BBH | 84.0 | % | 3-shot CoT |
定价
| 档位 | 价格(每百万 token) |
|---|
| 输入 | $2.00 |
| 输出 | $10.00 |
| 缓存读取 | $0.00 |
| 缓存写入 | $0.00 |
定价来源:https://x.ai/api (截至 2024-08-13)。
优势
- 通过 X 平台集成具备实时感知能力,旗舰中独有。
- 基准表现强劲,多数指标与 GPT-4o 竞争力相当。
- 支持文本与图像多模态输入。
- 内容策略相对宽松,拒绝率较低。
劣势
- 闭源专有模型,不支持自托管,企业合规认证有限。
- 不支持音频模态(不同于 GPT-4o)。
- 与 X 生态绑定较紧,部分企业采购方存在顾虑。
- 相较 OpenAI、Anthropic 等成熟厂商,市场经验尚浅。
适用场景
- 实时新闻与事件感知聊天机器人。
- 社交媒体内容生成与趋势分析。
- 时效性敏感的面向客户应用。
- 文本与图像结合的视觉问答。
参考文献