外观
模型与榜单速查
本文是《AI 热门概念手册》的"选型活页":主流闭源/开源模型一张表看清、排行榜怎么读不踩坑、以及"我的场景到底该用哪个模型"。数据截至 2025 年年中(frontmatter 中
dataAsOf: 2025-06)。
模型迭代的速度远超任何手册的更新速度,本页所有参数、价格、榜单排名都是"快照",使用前务必到官方核对。 大模型领域三个月就是一代:GPT 出了 o 系列、Claude 上了混合推理、Qwen 一年内从 2.5 升级到 3,榜单头名几乎每月换人。所以本页的定位不是"权威数据库",而是帮你建立选择框架:看哪几个维度、信哪类榜单、按什么逻辑选型。
时效性声明
本页信息截至 2025-06。模型版本(GPT-5、Llama 4 后续版等)、价格、上下文窗口、榜单排名此后可能均已变化。做任何技术决策前,请以官方文档为准。通用原理部分不受时效影响,可放心阅读。
闭源模型对比
闭源模型(以 API 方式开放)是当前"能力上限"的代表。对比时看五个维度:能力定位、上下文窗口、开放方式、定价量级、生态与工具链。
| 模型 | 厂商 | 能力定位 | 上下文窗口 | 开放方式 | 定价量级(每百万 token) |
|---|---|---|---|---|---|
| GPT-4o | OpenAI | 全能多模态(文本/图像/音频),指令跟随成熟 | 128K | API / 网页 / App | 输入约 $2.5,输出约 $10 |
| o3 / o4-mini | OpenAI | 推理模型:长思维链处理数学、代码、复杂规划 | 约 200K(o3)/ 约 200K(o4-mini) | API | 高于 GPT-4o,约 $2~$11 区间起 |
| Claude 3.5/3.7 Sonnet | Anthropic | 3.5 全能稳健;3.7 首创"混合推理"(快答+延长思考),代码与 Agent 强 | 200K | API / Claude 应用 | 输入约 $3,输出约 $15 |
| Gemini 2.x / 2.5 Pro | 原生多模态 + 超长上下文(2.5 Pro 1M 可申请 2M),推理增强 | 1M(2.5 Pro) | API / Gemini 应用 | 输入约 $1.25,输出约 $10 | |
| DeepSeek(V3/R1 API) | DeepSeek | 中文强、性价比极高;R1 推理模型 | 约 128K | API + 开源权重双通道 | 明显低于欧美主流(R1 约 $0.55/$2.19) |
| 豆包 Doubao 1.5/2.0 | 字节跳动 | 中文对话、多模态、工具调用,ToB 生态好 | 长文本支持 | API(火山引擎) | 人民币按量计费,价格有竞争力 |
| 通义千问 Qwen-Max/Turbo | 阿里云 | 中文强、多模态与 Agent 能力均衡,兼容 OpenAI 接口 | 长文本支持 | API(百炼平台) | 人民币计费,常有免费额度 |
| 文心 ERNIE 4.x | 百度 | 中文理解与生成、知识增强,与百度生态绑定 | 长文本支持 | API / 网页;ERNIE 4.5 已于 2025-06 开源 | 人民币计费 |
一句话判断
先别比参数,比"你要什么":要最强推理选 o3/Claude 3.7;要超长上下文做文档分析选 Gemini 2.5 Pro;要中文便宜大碗选 DeepSeek 或国产三家。闭源模型的通识对比逻辑见大语言模型。
开源模型对比
开源模型(开放权重)是"可控性"的代表:可本地部署、可微调、无 API 供应商锁定。评估维度是参数量、许可、特色、生态。
| 模型 | 参数量 | 许可 | 特色 | 生态 |
|---|---|---|---|---|
| Llama 3.1/3.2/3.3/4 | 3.3 主打 70B(3.1 旗舰 405B);Llama 4 Scout 约 109B(激活 17B)/ Maverick 约 400B | Llama 许可(可商用,月活超 7 亿需特别授权) | 全球生态最广:微调工具链、量化、部署文档最全 | 衍生模型海量,几乎"万物皆可 Llama" |
| Qwen 2.5 / Qwen3 | 2.5 从 0.5B 到 72B;Qwen3 从 0.6B 到 235B(含 MoE) | Apache-2.0 | 中文能力开源最强;Qwen3 引入混合推理模式(快/慢两种思维) | 魔搭与 HF 双平台,中文社区活跃 |
| DeepSeek-V3 / R1 | V3 与 R1 均为 671B(MoE,激活约 37B) | MIT | 高性价比 MoE 架构;R1 是开源推理模型的标杆,引发全球关注 | R1-Distill 系列蒸馏小模型适合本地部署 |
| Mistral / Mixtral | 7B、8x7B、8x22B 及 Small(23B)/ Medium(123B) | Apache-2.0 | 欧洲开源代表,MoE 先行者;代码专用模型 Codestral | 欧洲云与自托管平台支持好 |
| Phi-3 / Phi-4 | 3.8B / 7B / 14B(Phi-3);Phi-4 为 14B | MIT | 小参数量下的强推理与"教科书质量"数据训练,资源占用低 | 边缘设备、教学演示、本地部署友好 |
一句话判断
中文优先选 Qwen,生态跟随选 Llama,性价比与推理选 DeepSeek,小模型选 Phi。 开源模型最大的价值是可微调——用 peft + trl 把你的业务数据炼进模型,这是闭源 API 给不了的能力。
排行榜解读
三类主流榜单
| 榜单 | 机制 | 看什么 | 注意什么 |
|---|---|---|---|
| LMSYS Chatbot Arena | 用户盲测投票 + ElO 计分 | 综合对话体验的"民意测试" | 反映平均印象,不反映特定任务;票仓分布影响结果 |
| LLM Leaderboard(原 Open LLM Leaderboard) | 开源模型在标准化基准上自动跑分 | 开源模型的横向可复现对比 | 已升级到 2.0,改用指令后评测(IFEval、BBH、MATH 等),旧榜分数不可直接比较 |
| MMLU / GPQA / HumanEval 等基准榜 | 固定题库自动评分 | 知识广度(MMLU)、研究级推理(GPQA)、代码(HumanEval) | 单一基准有饱和与"刷榜"问题,详见LLM 评估与基准 |
截至 2025 年中你大概率看到的局面
- Arena 头部:GPT-4o/o3、Claude 3.7 Sonnet、Gemini 2.5 Pro 在 ElO 榜上轮流坐庄,差距在误差范围内,"谁第一"取决于你对风格的偏好。
- 开源侧:Qwen3 与 DeepSeek-R1 是"国产双雄",在中文与推理榜上常与闭源头部掰手腕;Llama 4 发布后评价分化,生态仍是最大护城河。
- 推理模型成为新主线:o3、DeepSeek-R1、Claude 3.7(思考模式)、Qwen3(混合推理)都把"想得久一点"当成能力增长点,数学与代码榜基本被推理模型包揽。
「榜单 ≠ 适用性」的警示
千万别按榜单挑模型
排名第一不等于适合你。榜单只测"平均答题能力",测不出三件事:① 你的领域数据表现(法律/医疗/你的私有文档);② 成本与延迟(最贵最快的模型做客服就是浪费);③ 隐私与合规(数据能不能出域)。正确的姿势是:用榜单筛选候选,再用你的真实业务评测集做最终决定——方法见搭建一套 LLM 评估。
按场景选型速查
| 场景 | 首选 | 备选 | 备注 |
|---|---|---|---|
| 中文对话 / 客服 | Qwen3、DeepSeek | 豆包、通义千问 | 中文语料质量 + 价格双优 |
| 代码生成与审查 | Claude 3.7 Sonnet | GPT-4o / o4-mini、Qwen2.5-Coder | 长上下文 + 代码理解;Copilot 案例可参考 |
| 长文档 RAG | Gemini 2.5 Pro(1M 上下文) | Claude 3.7(200K)、Qwen 长文本版 | 超长上下文减少切块成本,详见从零搭建 RAG 应用 |
| Agent 工具调用 | GPT-4o / Claude 3.7 | Qwen3、DeepSeek | 工具调用稳定性优先,参考AI 智能体与从零开发一个 Agent |
| 边缘 / 本地部署 | Phi-4、Qwen2.5-3B | Llama 3.2 1B/3B | 参数量与显存是硬约束,部署与推理优化实战有完整指南 |
嵌入模型与视觉模型速查
模型不止"生成型"。RAG 的检索质量、多模态的图文对齐,靠的是另一类专门模型。
| 类型 | 代表 | 特点 | 许可/开放方式 | 关联概念 |
|---|---|---|---|---|
| 嵌入(embedding) | BAAI bge-m3 | 中文/多语言检索强,RAG 首选开源嵌入 | 开源(MIT) | 向量数据库与语义检索 |
| 嵌入 | OpenAI text-embedding-3 | 英文及多语言,API 稳定省心 | 闭源 API | 向量数据库与语义检索 |
| 嵌入 | Cohere embed-v3 | 多语言,与 rerank 模型配套 | 闭源 API | 向量数据库与语义检索 |
| 视觉-语言对齐 | CLIP(OpenAI) | 图文配对训练的奠基模型,检索与生成都依赖它 | 开源 | 多模态模型 |
| 视觉-语言对齐 | SigLIP(Google) | CLIP 的改进版,对比损失更稳 | 开源 | 多模态模型 |
一句话判断
嵌入模型按语言与领域选(中文库优先 bge,英文库随便选 API),视觉模型看你想做"图文检索"还是"看图理解"——前者是 CLIP/SigLIP 的活,后者请直接上多模态 LLM。
获取模型的途径
| 途径 | 适合谁 | 说明 |
|---|---|---|
| Hugging Face | 全球开发者 | 开源权重与数据集的一站式托管,transformers 一行加载;国内可配合镜像站使用 |
| ModelScope(魔搭) | 国内开发者 | 阿里出品,中文模型最全(Qwen 官方首发地),国内下载速度快 |
| 官方 API 控制台 | 应用开发者 | OpenAI / Anthropic / Google / 火山引擎 / 阿里百炼 / 百度千帆,按量付费,免运维 |
| Ollama 模型库 | 本地玩家 | 一行命令跑开源模型,最适合个人体验与原型 |
| vLLM + 自托管 | 生产团队 | 开源权重 + 高吞吐推理,数据不出域,详见推理优化与量化 |
自托管 ≠ 免费
开源模型权重不要钱,但显卡、电力、运维都是钱。70B+ 模型单机跑不动、多卡又贵——选型时把"总拥有成本"算进去,这往往是"开源 vs 闭源"的真正决策点。
延伸阅读
- 数据集与工具档案 —— 选好模型后,训练与评测该用哪些数据
- LLM 评估与基准 —— 榜单背后的方法论与常见陷阱
- 大语言模型(LLM) —— 模型能力图谱与原理
- 微调与 PEFT(LoRA) —— 开源模型如何炼成你的专用模型
- AI 智能体(Agent) —— 工具调用能力怎么选型
- 部署与推理优化实战 —— 本地部署与成本控制
- 精选资源清单 与术语表 —— 更多资源与术语
- 学习路径 —— 把选型能力放进整体学习路线
参考资料
- OpenAI API 文档 —— GPT-4o / o 系列官方参数与定价
- Anthropic 模型文档 —— Claude 3.5/3.7 能力与定价
- Google Gemini 模型页 —— Gemini 2.x 上下文与定价
- DeepSeek API 定价 —— V3 / R1 的官方定价与上下文
- Qwen 官方 GitHub —— Qwen 系列开源发布说明
- LMSYS Chatbot Arena —— ElO 投票榜实时数据
- Hugging Face LLM Leaderboard —— 开源模型评测榜
- MMLU 论文 与 GPQA 论文 —— 基准原始出处
- bge 模型页 —— 开源嵌入模型官方说明
- CLIP 论文 —— 图文对齐模型原始论文(Radford et al., 2021)
本页所有模型参数、价格与排名均以各官方渠道截至 2025 年年中的信息整理,使用前请务必核对官方最新文档。