Skip to content

模型与榜单速查

本页速览 模型与榜单速查:截至 2025 年中的主流闭源与开源大模型对比表、排行榜解读与"榜单≠适用性"警示、按场景选型速查,以及嵌入模型、视觉模型与获取途径。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

模型与榜单速查 ​

本文是《AI 热门概念手册》的"选型活页":主流闭源/开源模型一张表看清、排行榜怎么读不踩坑、以及"我的场景到底该用哪个模型"。数据截至 2025 年年中(frontmatter 中 dataAsOf: 2025-06)。

模型迭代的速度远超任何手册的更新速度,本页所有参数、价格、榜单排名都是"快照",使用前务必到官方核对。 大模型领域三个月就是一代:GPT 出了 o 系列、Claude 上了混合推理、Qwen 一年内从 2.5 升级到 3,榜单头名几乎每月换人。所以本页的定位不是"权威数据库",而是帮你建立选择框架:看哪几个维度、信哪类榜单、按什么逻辑选型。

时效性声明

本页信息截至 2025-06。模型版本(GPT-5、Llama 4 后续版等)、价格、上下文窗口、榜单排名此后可能均已变化。做任何技术决策前,请以官方文档为准。通用原理部分不受时效影响,可放心阅读。

闭源模型对比 ​

闭源模型(以 API 方式开放)是当前"能力上限"的代表。对比时看五个维度:能力定位、上下文窗口、开放方式、定价量级、生态与工具链。

模型厂商能力定位上下文窗口开放方式定价量级(每百万 token)
GPT-4oOpenAI全能多模态(文本/图像/音频),指令跟随成熟128KAPI / 网页 / App输入约 $2.5,输出约 $10
o3 / o4-miniOpenAI推理模型:长思维链处理数学、代码、复杂规划约 200K(o3)/ 约 200K(o4-mini)API高于 GPT-4o,约 $2~$11 区间起
Claude 3.5/3.7 SonnetAnthropic3.5 全能稳健;3.7 首创"混合推理"(快答+延长思考),代码与 Agent 强200KAPI / Claude 应用输入约 $3,输出约 $15
Gemini 2.x / 2.5 ProGoogle原生多模态 + 超长上下文(2.5 Pro 1M 可申请 2M),推理增强1M(2.5 Pro)API / Gemini 应用输入约 $1.25,输出约 $10
DeepSeek(V3/R1 API)DeepSeek中文强、性价比极高;R1 推理模型约 128KAPI + 开源权重双通道明显低于欧美主流(R1 约 $0.55/$2.19)
豆包 Doubao 1.5/2.0字节跳动中文对话、多模态、工具调用,ToB 生态好长文本支持API(火山引擎)人民币按量计费,价格有竞争力
通义千问 Qwen-Max/Turbo阿里云中文强、多模态与 Agent 能力均衡,兼容 OpenAI 接口长文本支持API(百炼平台)人民币计费,常有免费额度
文心 ERNIE 4.x百度中文理解与生成、知识增强,与百度生态绑定长文本支持API / 网页;ERNIE 4.5 已于 2025-06 开源人民币计费

一句话判断

先别比参数,比"你要什么":要最强推理选 o3/Claude 3.7;要超长上下文做文档分析选 Gemini 2.5 Pro;要中文便宜大碗选 DeepSeek 或国产三家。闭源模型的通识对比逻辑见大语言模型。

开源模型对比 ​

开源模型(开放权重)是"可控性"的代表:可本地部署、可微调、无 API 供应商锁定。评估维度是参数量、许可、特色、生态。

模型参数量许可特色生态
Llama 3.1/3.2/3.3/43.3 主打 70B(3.1 旗舰 405B);Llama 4 Scout 约 109B(激活 17B)/ Maverick 约 400BLlama 许可(可商用,月活超 7 亿需特别授权)全球生态最广:微调工具链、量化、部署文档最全衍生模型海量,几乎"万物皆可 Llama"
Qwen 2.5 / Qwen32.5 从 0.5B 到 72B;Qwen3 从 0.6B 到 235B(含 MoE)Apache-2.0中文能力开源最强;Qwen3 引入混合推理模式(快/慢两种思维)魔搭与 HF 双平台,中文社区活跃
DeepSeek-V3 / R1V3 与 R1 均为 671B(MoE,激活约 37B)MIT高性价比 MoE 架构;R1 是开源推理模型的标杆,引发全球关注R1-Distill 系列蒸馏小模型适合本地部署
Mistral / Mixtral7B、8x7B、8x22B 及 Small(23B)/ Medium(123B)Apache-2.0欧洲开源代表,MoE 先行者;代码专用模型 Codestral欧洲云与自托管平台支持好
Phi-3 / Phi-43.8B / 7B / 14B(Phi-3);Phi-4 为 14BMIT小参数量下的强推理与"教科书质量"数据训练,资源占用低边缘设备、教学演示、本地部署友好

一句话判断

中文优先选 Qwen,生态跟随选 Llama,性价比与推理选 DeepSeek,小模型选 Phi。 开源模型最大的价值是可微调——用 peft + trl 把你的业务数据炼进模型,这是闭源 API 给不了的能力。

排行榜解读 ​

三类主流榜单 ​

榜单机制看什么注意什么
LMSYS Chatbot Arena用户盲测投票 + ElO 计分综合对话体验的"民意测试"反映平均印象,不反映特定任务;票仓分布影响结果
LLM Leaderboard(原 Open LLM Leaderboard)开源模型在标准化基准上自动跑分开源模型的横向可复现对比已升级到 2.0,改用指令后评测(IFEval、BBH、MATH 等),旧榜分数不可直接比较
MMLU / GPQA / HumanEval 等基准榜固定题库自动评分知识广度(MMLU)、研究级推理(GPQA)、代码(HumanEval)单一基准有饱和与"刷榜"问题,详见LLM 评估与基准

截至 2025 年中你大概率看到的局面 ​

  • Arena 头部:GPT-4o/o3、Claude 3.7 Sonnet、Gemini 2.5 Pro 在 ElO 榜上轮流坐庄,差距在误差范围内,"谁第一"取决于你对风格的偏好。
  • 开源侧:Qwen3 与 DeepSeek-R1 是"国产双雄",在中文与推理榜上常与闭源头部掰手腕;Llama 4 发布后评价分化,生态仍是最大护城河。
  • 推理模型成为新主线:o3、DeepSeek-R1、Claude 3.7(思考模式)、Qwen3(混合推理)都把"想得久一点"当成能力增长点,数学与代码榜基本被推理模型包揽。

「榜单 ≠ 适用性」的警示 ​

千万别按榜单挑模型

排名第一不等于适合你。榜单只测"平均答题能力",测不出三件事:① 你的领域数据表现(法律/医疗/你的私有文档);② 成本与延迟(最贵最快的模型做客服就是浪费);③ 隐私与合规(数据能不能出域)。正确的姿势是:用榜单筛选候选,再用你的真实业务评测集做最终决定——方法见搭建一套 LLM 评估。

按场景选型速查 ​

场景首选备选备注
中文对话 / 客服Qwen3、DeepSeek豆包、通义千问中文语料质量 + 价格双优
代码生成与审查Claude 3.7 SonnetGPT-4o / o4-mini、Qwen2.5-Coder长上下文 + 代码理解;Copilot 案例可参考
长文档 RAGGemini 2.5 Pro(1M 上下文)Claude 3.7(200K)、Qwen 长文本版超长上下文减少切块成本,详见从零搭建 RAG 应用
Agent 工具调用GPT-4o / Claude 3.7Qwen3、DeepSeek工具调用稳定性优先,参考AI 智能体与从零开发一个 Agent
边缘 / 本地部署Phi-4、Qwen2.5-3BLlama 3.2 1B/3B参数量与显存是硬约束,部署与推理优化实战有完整指南

嵌入模型与视觉模型速查 ​

模型不止"生成型"。RAG 的检索质量、多模态的图文对齐,靠的是另一类专门模型。

类型代表特点许可/开放方式关联概念
嵌入(embedding)BAAI bge-m3中文/多语言检索强,RAG 首选开源嵌入开源(MIT)向量数据库与语义检索
嵌入OpenAI text-embedding-3英文及多语言,API 稳定省心闭源 API向量数据库与语义检索
嵌入Cohere embed-v3多语言,与 rerank 模型配套闭源 API向量数据库与语义检索
视觉-语言对齐CLIP(OpenAI)图文配对训练的奠基模型,检索与生成都依赖它开源多模态模型
视觉-语言对齐SigLIP(Google)CLIP 的改进版,对比损失更稳开源多模态模型

一句话判断

嵌入模型按语言与领域选(中文库优先 bge,英文库随便选 API),视觉模型看你想做"图文检索"还是"看图理解"——前者是 CLIP/SigLIP 的活,后者请直接上多模态 LLM。

获取模型的途径 ​

途径适合谁说明
Hugging Face全球开发者开源权重与数据集的一站式托管,transformers 一行加载;国内可配合镜像站使用
ModelScope(魔搭)国内开发者阿里出品,中文模型最全(Qwen 官方首发地),国内下载速度快
官方 API 控制台应用开发者OpenAI / Anthropic / Google / 火山引擎 / 阿里百炼 / 百度千帆,按量付费,免运维
Ollama 模型库本地玩家一行命令跑开源模型,最适合个人体验与原型
vLLM + 自托管生产团队开源权重 + 高吞吐推理,数据不出域,详见推理优化与量化

自托管 ≠ 免费

开源模型权重不要钱,但显卡、电力、运维都是钱。70B+ 模型单机跑不动、多卡又贵——选型时把"总拥有成本"算进去,这往往是"开源 vs 闭源"的真正决策点。

延伸阅读 ​

参考资料 ​

本页所有模型参数、价格与排名均以各官方渠道截至 2025 年年中的信息整理,使用前请务必核对官方最新文档。