外观
前沿进展
"前沿"是一个陷阱词。它一边是机会——2024 至 2025 年几乎每个季度都有范式级变化;另一边是最密集的信息噪声——每天 arXiv 新增数百篇论文、每周都有模型发布、每条主线都有人在宣告"革命"。不加以方法地追,你会在噪声里耗尽精力;完全无视,你又可能错过这个领域十年来最重要的结构性变化。
本文聚焦 2024–2025 年(数据截至 2025 年年中)最值得关注的八条前沿主线,逐条拆解:现状是什么、代表论文与产品有哪些、卡在哪里。随后给出本文最重要的判断——哪些会留下、哪些是泡沫,最后是低成本、低噪声的跟踪方法。本文承接论文板块入口与论文地图的全局视角,与经典论文精读(讲清楚"过去")、阅读纪律与 FAQ(讲清楚"怎么读")互为补充。
时效性说明:模型版本、榜单与产品进度更新极快,文中事实截至 2025 年年中(dataAsOf 2025-06),之后请以模型与榜单速查为准。
一、八条前沿主线(2024–2025)
主线一:推理模型——"强化学习 + 思维链"成为新范式
现状。 2024 年 9 月 OpenAI 发布 o1,第一次把"在推理时多花计算(test-time compute)"产品化:模型用强化学习(Reinforcement Learning, RL)学会生成长长的内部思维链(Chain-of-Thought, CoT),想得越久、答得越准。2024 年 12 月 o3 预告、2025 年 4 月 o3/o4-mini 正式落地;2025 年 1 月 DeepSeek-R1 以开放权重完整复现这条路线,证明"RL 教推理"并非闭源实验室的专利。
与之前"提示词激发思考"不同,这一轮的核心是训练时的强化学习信号:先在数学、代码等答案可验证的领域用 RL 调教,模型自己涌现出反思、验证、回溯等行为。这套技术与对齐(RLHF、DPO 等偏好学习方法)是一体两面的家族——一个教能力、一个教价值观。完整机制拆解见 DeepSeek-R1 案例。
代表工作与产品。
| 工作/产品 | 时间 | 一句话要点 |
|---|---|---|
| Chain-of-Thought Prompting(Wei et al.) | 2022-01 | 提示里给推理示例,模型"想一步答一步",数学/常识推理大涨 |
| Let's Verify Step by Step(OpenAI) | 2023-05 | 过程奖励模型(PRM)逐步验证推理,是推理模型的直接先声 |
| o1 系列(Learning to Reason with LLMs) | 2024-09 | 大规模 RL 训练长思维链,竞赛数学/代码达人类专家水平 |
| DeepSeek-R1(DeepSeek) | 2025-01 | 用 GRPO 做纯 RL 教推理,公开权重并把能力蒸馏给小模型 |
| Scaling LLM Test-Time Compute Optimally | 2024-08 | 对可验证任务,"推理时多想"可能比"增大模型"更划算 |
| o3 / o4-mini | 2024-12 / 2025-04 | 推理链显式可读、能调用工具,把"想"与"做"连起来 |
关键问题。
- 奖励信号的边界:RL 需要可验证的答案(数学、代码)。写作、规划、开放问答没有唯一答案,如何构造奖励仍是开放问题——R1 论文自己承认这一点。
- 成本账:"想得久"意味着推理成本上升数十倍。哪些任务值得深度思考、如何自适应分配思考时间,是工程核心问题。
- 思考的透明度:长思维链真的在"推理"吗,还是更精致的模式匹配?机制层面的探索见主线七与安全与对齐。
一句话评估:推理模型是 2024–2025 年最确定的结构性趋势——"多花推理算力换能力"这条曲线在可验证任务上真实存在;但"所有任务都值得深思考"是泡沫。
主线二:长上下文——百万 token 与"上下文工程"
现状。 2024 年 2 月 Google 宣布 Gemini 1.5 原生支持 100 万 token 上下文(技术报告),随后各家把窗口拉到 128K–2M。窗口长了,问题从"装得下吗"变成"用得起吗":注意力是平方复杂度、KV 缓存吃显存、位置编码难外推。于是稀疏注意力、KV 缓存压缩、位置编码外推成为热点。2025 年初,DeepMind 的一篇论文正式命名了"上下文工程(Context Engineering)"——像写代码一样"编程"上下文,把提示、记忆、检索当作可调控的系统资源。这背后的部署与量化细节见推理优化与量化。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| Gemini 1.5 | 2024-02 | 首个百万级上下文的旗舰模型,长文档/视频/代码库一次装下 |
| Lost in the Middle(Liu et al.) | 2023-07 | 模型对长文档"首尾记得住、中间容易丢"——长度 ≠ 有效利用 |
| YaRN | 2023-09 | 神经缩放旋转位置编码外推,把 RoPE 窗口延展数倍 |
| LongRoPE | 2024-02 | 位置插值把上下文扩展到百万级而不需微调 |
| RingAttention | 2023-10 | 序列级并行,让超长上下文训练可扩展 |
| Infini-attention | 2024-04 | 压缩式记忆 + 局部注意力,单层结构处理无限长度 |
| Context Engineering for Neural Agents | 2025-01 | 命名"上下文工程":把上下文当作可编程的系统资源 |
关键问题。
- 名义长度 vs 有效长度:窗口大了,模型真的能"用到"深处吗?"Lost in the Middle" 表明长上下文的利用质量仍不均衡。
- 成本与延迟:KV 缓存随长度线性上涨,百万 token 推理的成本与延迟是现实约束。
- 评测缺失:长上下文基准往往只测"检索单个事实",对多跳推理、长程一致性覆盖不足——基准怎么读见评估与基准。
一句话评估:长上下文会留下——它是 Agent 与多模态记忆的底座;但"无差别无限窗口"是泡沫——稀疏化、压缩与检索的组合才是终局。
主线三:高效架构——状态空间模型、混合架构与 MoE
现状。 Transformer 统治的十年里,"注意力是平方复杂度"一直是隐痛。2023 年底 Mamba 用**状态空间模型(State Space Model, SSM)**把序列建模复杂度降到线性,一石激起千层浪;2024 年主流判断不再是"替代 Transformer",而是"混合":Transformer 负责全局精确匹配、SSM 负责线性低成本长程记忆(Jamba、Mamba-2 等)。与此同时,**专家混合(Mixture of Experts, MoE)**成为大模型的标准架构:总参数大、单个 token 只激活少数专家,用稀疏激活换容量——Mixtral、DeepSeek-V3、Llama 4 都在走这条路。基础机制见 Transformer 与注意力机制。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| Mamba(Gu & Dao) | 2023-12 | 选择性 SSM:线性复杂度的序列建模,超长序列优势明显 |
| Mamba-2 | 2024-05 | 把 SSM 统一到注意力框架下,又快又准 |
| Jamba(AI21) | 2024-03 | 首个生产级 Transformer + Mamba 混合架构 |
| Mixtral of Experts | 2024-01 | 稀疏 MoE:激活参数量减半仍能刷榜 |
| DeepSeek-V3 | 2024-12 | 671B 总参数 / 37B 激活的 MoE,训练成本只有同级模型的零头 |
关键问题。
- SSM 的天花板:纯 SSM 在超长程关联、精确检索上仍不如注意力,"混合比例"没有定论。
- MoE 的成本转移:MoE 把训练成本换成部署成本——所有专家都要驻留显存,路由不均衡、批处理效率都是活跃研究点。
- 稀疏化的可持续性:激活参数少是否压低能力上限?尚无定论。
一句话评估:混合架构与 MoE 会留下——它们是"有限算力下撑大模型"的主流解;"SSM 全面取代注意力"是泡沫,五年内更可能看到两者在分层架构里各司其职。
主线四:多模态统一——"任意输入、任意输出"
现状。 多模态从"视觉 + 语言"的双塔对齐(CLIP)走到生成式视觉语言模型(LLaVA、GPT-4V),2024 年再进一步:原生多模态(natively multimodal)——从第一行代码就把文本、图像、音频、视频当成同一种 token 流来训练,而不是后接一个视觉编码器。代表是 OpenAI 的 GPT-4o(2024-05)与 Google 的 Gemini 系列(2.0 起原生多模态)。2025 年的方向是"任意模态输入 → 任意模态输出"(any-to-any):同一个模型做文生图、图生文、音视频理解与生成。原理与取舍见多模态模型。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| CLIP | 2021-01 | 图文对比学习统一语义空间,多模态的基础设施 |
| Flamingo / BLIP-2 | 2022-04 / 2023-01 | 冻结视觉编码器 + 轻量连接层,低成本获得视觉能力 |
| Visual Instruction Tuning(LLaVA) | 2023-04 | 指令微调把视觉特征对齐进语言模型,开源 VLM 基准线 |
| GPT-4o | 2024-05 | 原生多模态端到端,语音对话延迟降到人类水平 |
| Gemini 2.0 | 2024-12 | 原生多模态 + 原生工具与图像生成,通向 Agent |
关键问题。
- 对齐的深度:VLM 的"理解"常停留在语义对齐(能说出"这是什么"),离像素级理解(精确空间关系、计数、物理直觉)仍远。
- 评估与方法论:多模态能力边界模糊,幻觉率、指令跟随的评测基准仍在快速演进。
- 数据与算力:任意模态的数据配比、token 化方案没有标准答案,训练成本成倍上升。
一句话评估:原生多模态会留下——它正在吞并"语音、视觉、语言"三个细分赛道;"模态越多 = 智能越强"是泡沫——模态增多并不自动等于推理变强,反而可能放大幻觉。
主线五:Agent 与工具——MCP、Computer Use 与多智能体
现状。 2024 年底到 2025 年,Agent 从"演示"走向"工程标准":Anthropic 2024 年 11 月开源模型上下文协议(Model Context Protocol, MCP),为"模型 ↔ 工具/数据"定义了统一接口;2024 年 10 月起 Anthropic 与 OpenAI 相继推出 Computer Use——让模型像人一样操作浏览器和桌面;2025 年 3 月 Manus 等"通用 Agent"产品引爆中文互联网。**多智能体协作(multi-agent)**成为研究热点:一个任务拆给多个角色分工的智能体,配上共享记忆与通信协议。体系化理解见AI 智能体(Agent),产品案例见 Manus 与 Agent 应用。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| ReAct | 2022-10 | 推理与行动交替,Agent 的思维原型 |
| Toolformer | 2023-02 | 模型自学调用工具,工具使用进入主流 |
| AgentBench | 2023-08 | 多环境 Agent 能力评估,标出 LLM 与人类的差距 |
| SWE-bench | 2023-10 | 真实 GitHub issue 基准,让"Agent 写代码"可量化 |
| Model Context Protocol(MCP) | 2024-11 | 工具/数据接入的统一协议,Agent 的"USB-C 接口" |
| Anthropic Computer Use / OpenAI CUA(Operator) | 2024-10 / 2025-01 | 让模型直接操作屏幕与软件,从"聊天"到"做事" |
| Building Effective Agents(Anthropic) | 2024-12 | 官方工程箴言:能简单就别上复杂多智能体 |
关键问题。
- 可靠性是生死线:一次 10 步的任务,单步 95% 成功率意味着整体只有约 60%。长程任务(几十步 + 记忆)的稳定性没有银弹。
- 评估滞后:SWE-bench 等基准快速饱和,真实世界开放式任务的评测仍是空白。
- 多智能体 vs 单智能体:多角色分工是否比一个强智能体更好?2025 年的实验结论越来越偏向"大部分时候单智能体 + 好工具就够"。
一句话评估:工具调用、MCP、Computer Use 会留下——它们是 Agent 的标准基建;"复杂多智能体框架"大概率是泡沫——业界共识正在回归"简单的代码 + 聪明的模型"。
主线六:视频与世界模型——Sora 与"预测物理"
现状。 2024 年 2 月 OpenAI 发布 Sora 技术报告《Video generation models as world simulators》,演示了长镜头一致性与初步物理直觉;12 月 Sora 2 正式上线,时长、可控性与一致性大幅提升。同期 DeepMind 的 Genie 用单张图生成可交互世界,"世界模型"从科幻词变成工程方向:用生成模型学习世界的时空规律,进而预测下一步。扩散模型与 Transformer 的结合(DiT)是背后的通用底座。原理见扩散模型与生成式 AI,完整案例见 Sora 与视频生成。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| Scalable Diffusion Models with Transformers(DiT) | 2022-12 | Transformer 化扩散模型,文生图/视频的通用底座 |
| Sora(技术报告) | 2024-02 | 宣称"世界模拟器",长镜头一致性的里程碑 |
| Genie(DeepMind) | 2024-02 | 单张图生成可交互 2D 世界,交互式世界模型 |
| Sora 2 | 2024-12 | 从"单镜头"到"多镜头 + 时间一致"的可控生成 |
| JEPA / 世界模型路线(LeCun) | 2022– | 用自监督预测表征,区别于生成式重建的另一种世界模型 |
关键问题。
- 物理一致性:物体持久性、因果交互仍会崩坏——"涌现物理"还是"数据插值"的争论没有结论。
- 两条世界模型路线:生成式(扩散重建像素)与预测式(JEPA 预测表征)谁更接近"理解世界",尚无定论。
- 成本与可控性:视频生成的推理成本、逐帧可控仍是落地门槛。
一句话评估:视频生成会留下——它是内容产业的重置开关;"世界模型已经理解物理"是泡沫——目前它更像"很会插值视频数据",离因果世界模型还差得远。
主线七:安全与对齐研究——可解释性与红队自动化
现状。 模型能力越强,"如何让它可靠、可控、可解释"越成为主线。2024–2025 年有两个显著进展:机制可解释性从"特征可视化"走向"规模化解读"——Anthropic 的字典学习(dictionary learning)从 4 层小模型扩展到旗舰模型内的千万级特征,再到 2025 年跨层特征(Crosscoders)初步定位"概念的神经坐标";红队自动化——用模型互相攻击、自动找漏洞,取代大部分人工红队。对齐方法本身也从 RLHF 演化出 DPO、RLAIF、Constitutional AI 等分支。全景见AI 安全与治理。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| InstructGPT(RLHF) | 2022-03 | 人类反馈强化学习,对齐的范式起点 |
| Constitutional AI | 2022-12 | AI 自我批评 + 原则约束,对齐与红队的自动化 |
| Red Teaming Language Models | 2022-09 | 自动化红队:用模型找模型的漏洞 |
| Direct Preference Optimization(DPO) | 2023-05 | 跳过奖励模型直接做偏好优化,训练大幅简化 |
| Towards Monosemanticity(字典学习) | 2023-10 | 用稀疏自编码器分解模型内部,找到"单个含义"的特征 |
| Scaling Monosemanticity(Golden Features) | 2024-05 | 把机制解读规模推进到旗舰模型内部 |
| Mapping the Mind of a LLM(Crosscoders) | 2025-02 | 跨层特征:定位概念"存在于网络的哪里" |
| Humanity's Last Exam | 2025-01 | 高难能力基准:给"模型已超越专家"的叙事泼冷水 |
关键问题。
- 可解释性的规模瓶颈:特征找到不少,但"读懂这些特征如何组合成行为"仍是手工活。
- 可证明的安全:所有防线都是经验性的,没有形式化保证;红队只能证明"找到过漏洞",不能证明"没有漏洞"。
- 技术对齐与治理的张力:训练方法(技术对齐)与监管审计(治理)如何配合,是 2025 年最现实的议题。
一句话评估:可解释性与自动化红队会留下——它们是不可逆的基础设施;"可解释性已能解释大模型"是泡沫——我们仍在"读特征"阶段,离"读懂思维"很远。
主线八:从"对话"到"自主产出"——Agentic RL、Vibe Coding 与 AI Scientist
现状。 2025 年最鲜明的信号是:AI 不再只"回答",开始"干活",而且"干活的方式"本身正在被训练。三个方向交汇:**Agentic RL(智能体强化学习)**把强化学习从"选回答"升级到"执行多步任务"——DeepSeek-R1 用大规模 RL 训练"想清楚再回答"(见DeepSeek-R1 与推理模型),2024 年底的 Agentic RL 论文(arXiv:2501.03266)进一步用 RL 训练 Agent 的搜索与推理双能力,2025 年多家机构跟进用 RL 训练规划与工具调用;**Vibe Coding(氛围编程)**由 Karpathy 于 2025 年 2 月提出,指"用自然语言描述意图、让 AI 写代码、人只审查"的编程方式,配合 Claude Code、Cursor 等 Agent 化工具,代码生产从"手写"转向"指挥 + 审查"(见GitHub Copilot 与代码智能);AI Scientist 把"读文献 → 提假设 → 做实验 → 写论文"整条科研流水线自动化(Sakana AI 的 AI Scientist-v2,2024 年 8 月),开启"科研 Agent"叙事,与 AlphaFold 式的单点突破互补(见AlphaFold 与 AI for Science)。
代表工作。
| 工作 | 时间 | 一句话要点 |
|---|---|---|
| Agentic RL(arXiv:2501.03266) | 2024-11 | 系统性用 RL 训练"搜索 + 推理"双能力的 Agent,Agentic RL 范式起点 |
| DeepSeek-R1 | 2025-01 | 大规模 RL 训练推理模型的里程碑,开源引爆推理模型浪潮 |
| The AI Scientist-v2 | 2024-08 | 端到端自动化科研 Agent,可独立完成"文献 → 实验 → 论文"闭环 |
| Claude Code / Cursor | 2024–2025 | Agent 化编程工具的产业代表,Vibe Coding 的落地载体 |
关键问题。
- 奖励设计:Agentic RL 的稀疏长程任务如何给奖励、如何避免"走捷径"(reward hacking),仍是开放问题。
- 代码质量与安全:Vibe Coding 让"写代码"门槛消失,但审查责任更重——代码幻觉、供应链与越权风险都要人兜底(见常见陷阱与反模式)。
- 科研伦理:AI Scientist 产出的"论文工厂"引发可重复性、署名与科研诚信争议。
一句话评估:Agentic RL 会留下——它把"推理"与"行动"统一进训练目标,是 Agent 走向可靠的关键;"Vibe Coding 取代程序员"是泡沫——它改变的是写代码的方式,不是"需要会写代码的人";AI Scientist 会留下但兑现慢——科研的瓶颈不在"写论文",而在"设计实验与判断什么重要"。
二、哪些会留下、哪些是泡沫
把八条主线压缩成一张判断表——这是本文最值得带走的部分:
| 主线 | 会留下 | 可能是泡沫 | 一句话评估 |
|---|---|---|---|
| 推理模型 | RL + CoT、test-time compute、过程奖励 | "所有任务都值得深思考" | 确定的结构性趋势,但只在可验证任务上兑现 |
| 长上下文 | 稀疏注意力、KV 压缩、检索、上下文工程 | "无限窗口 + 一次全塞" | 会留下,但以"工程组合"的形态而非蛮力 |
| 高效架构 | MoE、混合架构(Transformer + SSM)、蒸馏 | "SSM 完全取代注意力" | 有限算力下的必然选择,替代叙事不成立 |
| 多模态统一 | 原生多模态、any-to-any、统一 token 流 | "模态越多智能越强" | 会吞并细分赛道,但模态不自动等于能力 |
| Agent 与工具 | MCP、Computer Use、工具调用、Agentic Coding | 复杂多智能体框架 | 基建确定,复杂框架正在退潮 |
| 视频与世界模型 | 视频生成、可控生成、扩散模型 | "世界模型已理解物理" | 内容革命确定,物理理解未兑现 |
| 安全与对齐 | 机制可解释性、自动化红队、对齐算法 | "可解释性已可解释模型" | 不可逆的基础设施,进展被高估 |
| Agentic RL 与 AI 科学家 | Agentic RL 训练范式、Agent 化编程工具 | "Vibe Coding 取代程序员""AI 全自动科研" | 训练范式会留下;产品叙事兑现慢 |
一句话心法
判断"什么会留下",看它是否在给"别人离不开的能力"当底座:MCP 是底座、多智能体框架不是;稀疏注意力是底座、无限上下文不是;RL 教推理是底座、"什么都能多想一会儿"不是。底座会留下,附在底座上的叙事会退潮。
三、如何跟踪前沿
前沿信息不是太少,而是太多。有效的做法不是"全读",而是建立一条有优先级的信号管道。
1. arXiv:一手战场,订阅作者而非刷列表
| 分类 | 主题 | 说明 |
|---|---|---|
| cs.LG | 机器学习 | 总战场,覆盖面最大 |
| cs.CL | 计算语言学 / NLP | LLM 论文主阵地 |
| cs.CV | 计算机视觉 | 多模态、视频生成常发于此 |
| cs.AI | 人工智能 | Agent、推理、通用方法 |
每日数百篇,直接刷列表没有意义。跟作者比跟列表强:在 arXiv 订阅你精读过的论文作者的新提交;用 Hugging Face Papers 按热度聚合,用 arXiv Sanity 按相似度过滤。只精读高信号论文:题目回应你的问题、作者有延续性、同时发布代码与权重。
2. X/Twitter:研究者动态是最早的信号
一线研究者往往在论文写出来之前就表态,值得长期关注:
- Andrej Karpathy(@karpathy):架构、训练细节、深度学习教育;
- Yann LeCun(@ylecun):世界模型路线、JEPA;
- Sebastian Raschka(@rasbt):论文解读与实现细节;
- Chip Huyen(@chipro)、Simon Willison(@simonw):工程与产品视角;
- 实验室官方账号(OpenAI、Anthropic、Google DeepMind、Meta AI、DeepSeek、Hugging Face):一手发布。
信号 vs 噪声
X 上的热度与重要性相关性不高:营销、情绪化辩论与标题党占大多数。建议把关注控制在 20 个以内,把他们的发言当"待验证的假设"而不是结论——真正决定判断的,是你自己读过的论文与跑过的实验。
3. 顶会:沉淀后的系统知识
| 会议 | 领域 | 每年大致时间 |
|---|---|---|
| NeurIPS | 机器学习(综合) | 12 月 |
| ICML | 机器学习 | 7 月 |
| ICLR | 表示学习 / 深度学习 | 4–5 月 |
| ACL / EMNLP | 自然语言处理 | 7 月 / 11 月 |
| CVPR | 计算机视觉 | 6 月 |
不必参会:录用名单公布时扫一遍标题,会议结束后看 Tutorial 与 Survey——一两个高质量 Tutorial 比五十篇论文管用,它们把该领域的坐标系讲清楚了。完整阅读方法见论文阅读路径。
4. 评测站:把"感觉"换成"数字"
| 渠道 | 用途 |
|---|---|
| LMArena | 人工盲测对战,综合能力最可信的榜单一类 |
| Papers with Code | 任务 → SOTA → 论文 → 代码 |
| Artificial Analysis | 把"强不强"与"贵不贵、快不快"放在一起看 |
| Hugging Face Papers | 每日论文热度 + 代码 + 讨论 |
速度高 ┌──────────────────────────────────────────────┐
│ X/博客、实验室动态 ── 信号,噪声最多 │
│ arXiv 每日更新 ── 一手论文 │
│ 评测榜 / HF 论文日报 ── 聚合 + 数字 │
│ 顶会论文与教程 ── 沉淀后知识 │
深度高 └──────────────────────────────────────────────┘
读得越深,判断越稳;追得越急,越容易被带偏。一周节奏建议
每天 20 分钟:早上扫 HF Papers 标题与关注学者的转发,只精读 1 篇。每月固定半天:读一篇综述、查一次 LMArena 与模型榜单。剩下的时间用来复现与写笔记——那是判断力真正沉淀的地方。完整的长期规划见学习路径总览。
延伸阅读
- 从这里开始 —— 论文板块总入口,含检索与阅读方法
- 论文地图 —— 用一张图把握从经典到前沿的坐标
- 经典论文精读 —— 本文引用论文中"已成经典"部分的精读
- 阅读纪律与 FAQ —— 三遍阅读法、红旗信号表与高频问答
- DeepSeek-R1 案例 —— 推理模型范式的完整拆解
- Sora 与视频生成 —— 世界模型叙事的来龙去脉
- Transformer 与注意力机制 —— 一切架构演进的起点
- 多模态模型 —— 模态统一的机制与取舍
- AI 智能体(Agent) —— 工具调用与多智能体的原理
- AI 安全与治理 —— 对齐、可解释性与红队
- 推理优化与量化 —— 长上下文与推理成本落地
- LLM 评估与基准 —— benchmark 怎么读、怎么用
- 演进简史 —— 前沿在往年坐标中的位置
- 模型与榜单速查 —— 追踪模型版本与榜单
- 精选资源清单 —— 追踪前沿的工具箱
参考资料
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv:2501.12948)
- OpenAI. Learning to Reason with LLMs(o1 系列)
- OpenAI. Introducing o3 and o4-mini
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(arXiv:2201.11903)
- Let's Verify Step by Step(arXiv:2305.20050)
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters(arXiv:2408.03314)
- Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context(arXiv:2403.05530)
- Lost in the Middle: How Language Models Use Long Contexts(arXiv:2307.03172)
- YaRN: Efficient Context Window Extension of Large Language Models(arXiv:2309.00071)
- LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens(arXiv:2402.13753)
- RingAttention with Blockwise Transformers for Near-Infinite Context(arXiv:2310.06236)
- Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention(arXiv:2404.07143)
- Context Engineering for Neural Agents(arXiv:2501.17437)
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces(arXiv:2312.00752)
- Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality(Mamba-2, arXiv:2405.21060)
- Jamba: A Hybrid Transformer-Mamba Language Model(arXiv:2403.19887)
- Mixtral of Experts(arXiv:2401.04088)
- DeepSeek-V3 Technical Report(arXiv:2412.19437)
- OpenAI. Hello GPT-4o
- Learning Transferable Visual Models From Natural Language Supervision(CLIP, arXiv:2103.00020)
- Visual Instruction Tuning(LLaVA, arXiv:2304.08485)
- OpenAI. Video Generation Models as World Simulators(Sora 技术报告)
- OpenAI. Sora 2
- Genie: Generative Interactive Environments(arXiv:2402.15391)
- Scalable Diffusion Models with Transformers(DiT, arXiv:2212.09748)
- Model Context Protocol 官方文档
- Anthropic. Introducing Computer Use(Claude 3.5)
- OpenAI. Introducing the Computer-Using Agent(Operator)
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues?(arXiv:2310.06770)
- AgentBench: Evaluating LLMs as Agents(arXiv:2308.03688)
- Anthropic. Building Effective Agents
- Anthropic. Towards Monosemanticity(Transformer Circuits)
- Anthropic. Scaling Monosemanticity(Golden Features, Transformer Circuits)
- Mapping the Mind of a Large Language Model(Crosscoders, arXiv:2502.16021)
- Training Language Models to Follow Instructions with Human Feedback(InstructGPT, arXiv:2203.02155)
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model(arXiv:2305.18290)
- Constitutional AI: Harmlessness from AI Feedback(arXiv:2212.08073)
- Red Teaming Language Models to Reduce Harms(arXiv:2209.07858)
- Humanity's Last Exam(arXiv:2501.14249)
- arXiv(cs.LG / cs.CL 最新提交)
- Hugging Face Papers
- Papers with Code
- LMArena
- Artificial Analysis
- arXiv Sanity Preserver