核心规格
| 厂商 | xai |
| 版本 | 2 |
| 发布日期 | 2024-08-13 |
| 上下文窗口 | 131072 tokens |
| 输入模态 | text, image |
| 输出模态 | text |
| 许可 | Proprietary |
| 文档 | https://docs.x.ai/ |
基准测试表现
| 基准 |
得分 |
单位 |
评测日期 |
备注 |
来源 |
| MMLU |
87.5 |
% |
2024-08-13 |
5-shot |
查看 |
| HUMANEVAL |
88.4 |
pass@1 |
2024-08-13 |
— |
查看 |
| GSM8K |
93.2 |
% |
2024-08-13 |
0-shot CoT |
查看 |
| MATH |
76.8 |
% |
2024-08-13 |
0-shot CoT |
查看 |
| BBH |
84 |
% |
2024-08-13 |
3-shot CoT |
查看 |
定价
| 项目 |
价格 |
币种 |
| 输入 | $2 / Mtok | USD |
| 输出 | $10 / Mtok | USD |
| 缓存读 | $0 / Mtok | USD |
| 缓存写 | $0 / Mtok | USD |
数据来源:
https://x.ai/api
· 截至 2024-08-13
合规性
- 数据驻留: US
- SOC2: ✗
- HIPAA: ✗
- GDPR: ✗
- ISO 27001: ✗
Grok-2
模型概述
Grok-2 是 xAI 于 2024 年 8 月 13 日发布的旗舰模型。模型最大亮点是与 X(原 Twitter)平台的紧密集成,可对实时事件与热门话题保持感知——这是其他旗舰模型无法匹配的能力。Grok-2 接受文本与图像输入,支持 131K 上下文窗口,在学术基准上与 GPT-4o、Claude 3.5 Sonnet 同台竞争。MMLU 得分 87.5,接近 GPT-4o(88.7)与 Claude 3.5 Sonnet(88.7)。模型可通过 X 平台的 Grok 聊天机器人(Premium 订阅用户)与 xAI API 调用。Grok-2 还以相对宽松的内容策略著称,xAI 将其作为面向希望减少拒绝率用户的特点进行宣传。
核心规格
| 属性 |
数值 |
| 厂商 |
xAI |
| 版本 |
2 |
| 发布日期 |
2024-08-13 |
| 上下文窗口 |
131,072 tokens |
| 输入模态 |
文本、图像 |
| 输出模态 |
文本 |
| 许可证 |
专有 |
| 文档地址 |
https://docs.x.ai/ |
基准测试表现
| 基准 |
得分 |
单位 |
备注 |
| MMLU |
87.5 |
% |
5-shot |
| HumanEval |
88.4 |
pass@1 |
— |
| GSM8K |
93.2 |
% |
0-shot CoT |
| MATH |
76.8 |
% |
0-shot CoT |
| BBH |
84.0 |
% |
3-shot CoT |
定价
| 档位 |
价格(每百万 token) |
| 输入 |
$2.00 |
| 输出 |
$10.00 |
| 缓存读取 |
$0.00 |
| 缓存写入 |
$0.00 |
定价来源:https://x.ai/api (截至 2024-08-13)。
优势
- 通过 X 平台集成具备实时感知能力,旗舰中独有。
- 基准表现强劲,多数指标与 GPT-4o 竞争力相当。
- 支持文本与图像多模态输入。
- 内容策略相对宽松,拒绝率较低。
劣势
- 闭源专有模型,不支持自托管,企业合规认证有限。
- 不支持音频模态(不同于 GPT-4o)。
- 与 X 生态绑定较紧,部分企业采购方存在顾虑。
- 相较 OpenAI、Anthropic 等成熟厂商,市场经验尚浅。
适用场景
- 实时新闻与事件感知聊天机器人。
- 社交媒体内容生成与趋势分析。
- 时效性敏感的面向客户应用。
- 文本与图像结合的视觉问答。
参考文献