大模型评测
全面评测国内外主流AI大语言模型,帮助您选择最适合的AI工具
评测维度
GPT-4.5
OpenAI · 商用
OpenAI最新旗舰模型,综合能力全面领先,具备超强推理和多模态理解能力。
Claude 3.5 Sonnet
Anthropic · 商用
安全性极强,擅长处理长文本和复杂指令,支持2M+上下文窗口。
Gemini 2.0 Ultra
Google · 商用
Google最新旗舰模型,多模态能力突出,支持视频理解和复杂推理。
DeepSeek R1
深度求索 · 商用
国产开源模型新秀,推理能力突出,支持128K上下文,性价比高。
Qwen2.5-Max
阿里云 · 商用/开源
阿里云通义千问系列最新模型,中文理解能力强,支持免费商用。
文心一言4.0
百度 · 商用
百度最新版文心一言,中文理解能力强,集成丰富的知识图谱和搜索能力。
Kimi K2.5
Moonshot · 商用
月之暗面推出的大语言模型,擅长长文档理解和代码分析,支持200K+上下文。
性能对比表格
| 模型名称 | 综合得分 | 推理能力 | 编程能力 | 长上下文 | 多模态 | 价格 |
|---|---|---|---|---|---|---|
| GPT-4.5 | 82.5 | ★★★★★ | ★★★★★ | ★★★★ | ★★★★★ | ¥¥¥ |
| Claude 3.5 Sonnet | 79.8 | ★★★★★ | ★★★★ | ★★★★★ | ★★★★ | ¥¥ |
| Gemini 2.0 Ultra | 76.5 | ★★★★ | ★★★★ | ★★★★ | ★★★★★ | ¥¥¥ |
| DeepSeek R1 | 70.5 | ★★★★ | ★★★ | ★★★★ | ★★★ | ¥ |
| Qwen2.5-Max | 69.2 | ★★★★ | ★★★ | ★★★★ | ★★★ | ¥ |
| 文心一言4.0 | 67.2 | ★★★ | ★★★ | ★★★★ | ★★★★ | ¥¥ |
| Kimi K2.5 | 63.8 | ★★★ | ★★★ | ★★★★ | ★★ | ¥¥ |
注:价格评级 ¥=免费/低价,¥¥=中等,¥¥¥=较高