机器学习核心概念解析
| 论文 | 日期 | 简介 |
|---|---|---|
| Transformer | June 2017 | 一种编码器-解码器模型,首次将多头注意力机制引入机器翻译任务。 |
| Elmo | February 2018 | 深层上下文词表示,能够捕捉词汇用法的细微特征以及不同语境下的上下文变化。 |
| Marian MT | April 2018 | 纯 C++ 编写的神经机器翻译框架,依赖极少,为高速训练与翻译而设计。 |
| GPT | June 2018 | 仅解码器 Transformer,先自回归预训练,再通过任务相关的输入变换针对下游任务微调。 |
| BERT | October 2018 | 首次将预训练引入编码器 Transformer;各任务采用统一架构。 |
| Transformer XL | January 2019 | 在自注意力机制中引入循环机制,使 Transformer 可处理更长的文本序列。 |
| XLM | January 2019 | 提出两种跨语言语言模型学习方法:仅依赖单语数据的无监督方法,以及利用平行数据与新跨语言目标的有监督方法。 |
| GPT 2 | February 2019 | 证明语言模型无需显式监督即可学会多种语言处理任务。 |
| Sparse Transformer | April 2019 | 对注意力矩阵引入稀疏分解,将时间与显存消耗降至 O(n√n)(序列长度)。 |
| UniLM | May 2019 | 共享 Transformer 网络并使用特定自注意力掩码,在语言理解与生成任务上均表现出色。 |
| XLNet | June 2019 | Transformer-XL 的扩展,采用融合 AR 与 AE 思想的新方法进行预训练。 |
| RoBERTa | July 2019 | 在 BERT 基础上精心调优超参数与训练数据规模,提升多项语言任务性能。 |
| Sentence BERT | August 2019 | BERT 的变体,采用孪生与三元组网络结构生成可用余弦相似度比较的句向量。 |
| CTRL | September 2019 | 1.63B 语言模型,可基于控制码(控制风格、内容与任务行为)生成文本,实现对文本生成的显式控制。 |
| Tiny BERT | September 2019 | 通过注意力迁移与任务特定的知识蒸馏对 BERT 进行蒸馏。 |
| ALBERT | September 2019 | 提出参数缩减技术,降低 BERT 的显存占用并加快训练速度。 |
| Distil BERT | October 2019 | 在大批量(梯度累积)上蒸馏 BERT,采用动态掩码,并去掉下一句预测目标。 |
| Distil RoBERTa | October 2019 | 用与 Distil BERT 相同的技术蒸馏 RoBERTa。 |
| T5 | October 2019 | 统一的编码器-解码器框架,将所有基于文本的语言问题转换为文本到文本格式。 |
| BART | October 2019 | 编码器-解码器模型,预训练目标是从损坏文本中重建原始文本。 |
| XLM-Roberta | November 2019 | 在 100 种语言文本上预训练的多语言掩码语言模型;大规模多语言预训练显著提升跨语言迁移任务性能。 |
| XLM-Roberta | November 2019 | 在 100 种语言文本上预训练的多语言掩码语言模型;大规模多语言预训练显著提升跨语言迁移任务性能。 |
| Pegasus | December 2019 | 面向生成式文本摘要的自监督预训练目标:从输入文档中删除/掩码重要句子,并将它们作为一个输出序列生成。 |
| Reformer | January 2020 | 用局部敏感哈希替代点积注意力(复杂度 O(Llog L)),用可逆残差层只存储一次激活,并将前馈层激活分块,性能与 Transformer 持平,但显存效率更高、长序列更快。 |
| mBART | January 2020 | 多语言序列到序列去噪自编码器,在多种语言的大规模单语语料上用 BART 目标预训练完整的自回归模型,显著提升机器翻译性能。 |
| UniLMv2 | February 2020 | 采用伪掩码语言模型(PMLM),同时支持自编码与部分自回归语言建模,显著提升语言模型在各类 NLP 任务上的能力。 |
| ELECTRA | March 2020 | 提出样本高效的预训练任务"替换词元检测":用合理的替代词元替换部分输入,训练判别模型判断每个词元是否被替换。 |
| FastBERT | April 2020 | 速度可调的编码器,推理时间自适应,在每个 Transformer 输出处设分支以实现提前输出。 |
| MobileBERT | April 2020 | BERT 的压缩加速版本,采用瓶颈结构、优化的注意力机制与知识迁移。 |
| Longformer | April 2020 | 引入线性可扩展的注意力机制,可处理更长的文本。 |
| GPT 3 | May 2020 | 证明扩大语言模型规模可大幅提升任务无关的少样本性能。 |
| DeBERTa | June 2020 | 通过解耦注意力机制、增强的掩码解码器与虚拟对抗训练改进 BERT 和 RoBERTa。 |
| DeBERTa v2 | June 2020 | DeBERTa 的增强版:新词表、集成 nGiE、优化的注意力机制、更多模型尺寸与改进的分词。 |
| T5 v1.1 | July 2020 | 原始 T5 的增强版:GEGLU 激活、预训练无 dropout、仅在 C4 上预训练、嵌入层与分类器层不再共享参数。 |
| mT5 | October 2020 | 基于 T5 v1.1 的多语言变体,在覆盖 101 种语言的新 Common Crawl 数据集(mC4)上预训练。 |
| Codex | July 2021 | 在 GitHub 公开代码上微调的 GPT 语言模型。 |
| FLAN | September 2021 | 指令微调语言模型,在用自然语言指令描述的多种 NLP 数据集上微调得到。 |
| T0 | October 2021 | 在覆盖多种任务的多任务混合数据上微调的编码器-解码器模型,在多个标准数据集上取得强大的零样本性能。 |
| DeBERTa V3 | November 2021 | 用替换词元检测(RTD)替代掩码语言建模(MLM),并引入梯度解耦的嵌入共享方法,在多种自然语言理解任务上表现更优。 |
| WebGPT | December 2021 | 基于 GPT-3 的微调模型,支持基于文本的网页浏览,通过模仿学习与人类反馈训练,提升长回答的事实准确性。 |
| Gopher | December 2021 | 全面分析不同规模(最高 280B)Transformer 模型在 152 个任务上的性能。 |
| LaMDA | January 2022 | 专为对话设计的基于 Transformer 的模型,在公开对话数据与网页文本上预训练。 |
| BERTopic | March 20222 | 利用 Sentence-BERT 生成文档嵌入,结合 UMAP、HDBSCAN(软聚类)与改进的基于类别的 TF-IDF,支持单文档多主题与主题的动态演化。 |
| Instruct GPT | March 2022 | 结合监督学习(指令微调)与人类反馈强化学习微调 GPT,使其与用户意图对齐。 |
| CodeGen | March 2022 | 面向程序合成的大语言模型,基于输入输出样例与自然语言描述训练。 |
| Chinchilla | March 2022 | 在给定计算预算下研究训练 Transformer 大模型的最优模型规模与词元数量(缩放定律)。 |
| PaLM | April 2022 | 540B 参数的稠密激活 Transformer,基于 Pathways 训练(支持跨多个 TPU Pod 高效训练的 ML 系统)。 |
| GPT-NeoX-20B | April 2022 | 在 Pile 上训练的自回归大模型,是当时公开权重的最大稠密模型。 |
| OPT | May 2022 | 一系列仅解码器的预训练 Transformer,参数从 125M 到 175B;OPT-175B 与 GPT-3 相当。 |
| Flan T5, Flan PaLM | October 2022 | 探索指令微调,重点研究任务数量扩展、模型规模扩展,以及在思维链数据上的微调。 |
| BLOOM | November 2022 | 176B 参数的开放仅解码器 Transformer,由数百名研究者协作开发,旨在普及大模型技术。 |
| BLOOMZ, mT0 | November 2022 | 在英文任务与英文提示上对预训练多语言模型做多任务提示微调,使其在仅出现在预训练语料中的非英文语言上实现任务泛化。 |
| Galactica | November 2022 | 在科学数据上训练的大模型,专攻科学知识。 |
| ChatGPT | November 2022 | 基于 GPT 3.5 的交互式对话模型。 |
| Self Instruct | December 2022 | 通过自举模型自身生成内容,提升预训练语言模型指令遵循能力的框架。 |
| LLaMA | February 2023 | Meta 的基础大模型系列,参数从 7B 到 65B,仅使用公开数据集训练。 |
| Toolformer | February 2023 | 可自主决定调用哪些 API、何时调用、传入什么参数,并将结果融入后续词元预测的大模型。 |
| Alpaca | March 2023 | 微调的 LLaMA 7B 模型,训练数据是 text-davinci-003 以 self-instruct 风格生成的指令遵循样本。 |
| GPT 4 | March 2023 | 多模态 Transformer 模型,预训练目标是预测文档中的下一个词元,可接受图像与文本输入并输出文本。 |
| Vicuna | March 2023 | 在 ShareGPT 收集的用户共享对话上微调的 13B LLaMA 聊天模型,回答比 Alpaca 更详细、结构更清晰。 |
| BloombergGPT | March 2023 | 50B 语言模型,在通用与金融领域数据上训练,支持金融行业多种任务。 |
| Pythia | April 2023 | 16 个大模型的系列,全部在公开数据上按完全相同的顺序训练,参数从 70M 到 12B。 |
| WizardLM | April 2023 | 提出 Evol-Instruct 方法:用大模型而非人工生成不同复杂度的海量指令数据,用于微调 Llama 模型。 |
| CodeGen2 | May 2023 | 通过统一模型架构、学习方法、填充采样与数据分布等关键组件,使面向程序合成的大模型训练更高效。 |
| PaLM 2 | May 2023 | PALM 的后继者,在多种预训练目标的混合数据上训练,以理解语言的不同方面。 |
| LIMA | May 2023 | 仅在 1000 条精心筛选的提示与回答上微调的 LLaMa 模型,未使用强化学习或人类偏好建模。 |
| Gorilla | May 2023 | 针对 API 调用的检索感知微调 LLaMA-7B 模型。 |
| Orca | June 2023 | 提出新方法解决指令微调的局限:利用更丰富的模仿信号、扩展任务与指令,并用教师助手辅助渐进式学习。 |
| Falcon | June 2023 | 开源大模型,仅在经过充分过滤与去重的网页数据上训练。 |
| Phi-1 | June 2023 | 面向代码的大模型,训练数据包括网页上的教科书质量数据,以及 GPT-3.5 合成的教科书与练习题。 |
| WizardCoder | June 2023 | 通过 Code Evol-Instruct 提升开源代码大模型 StarCoder 的性能。 |
| Tulu | June 2023 | 在 12 种不同指令数据集上对 6.7B 到 65B 参数的语言模型进行指令微调的研究。 |
| LLaMA 2 | July 2023 | LLaMA 的后继者;LLaMA 2-Chat 针对对话场景优化。 |
| Tool LLM | July 2023 | 在用 ChatGPT 自动构建的工具使用指令微调数据集上微调的 LLaMA 模型。 |
| Humpback | August 2023 | 使用指令反向翻译(instruction backtranslation)微调的 LLaMA。 |
| Code LLaMA | August 2023 | 基于 LLaMA 2 的代码大模型。 |
| WizardMath | August 2023 | 提出基于 Evol-Instruct 反馈的强化学习(RLEIF)方法,应用于 Llama-2 以增强数学推理能力。 |
| LLaMA 2 Long | September 2023 | 一系列长上下文大模型,有效上下文窗口最高达 32,768 词元。 |
| Phi-1.5 | September 2023 | 延续 phi-1 的思路,这次聚焦自然语言中的常识推理。 |
| MAmmoTH | September 2023 | 专为通用数学问题求解设计的大模型系列,在 MathInstruct 数据集上训练;该数据集汇集 13 个数学数据集及其中间推理过程,融合思维链与程序思维两种方法以适应不同数学问题的思维过程。 |
| Mistral 7B | October 2023 | 采用分组查询注意力加速推理,结合滑动窗口注意力,以更低的推理成本处理任意长度的序列。 |
| Llemma | October 2023 | 面向数学的大模型,在科学论文、含数学的网页数据与数学代码的混合数据上继续预训练 Code Llama 得到。 |
| CodeFusion | October 2023 | 扩散式代码生成模型,基于编码的自然语言迭代优化整个程序,克服了自回归模型在代码生成中无法回看先前词元的局限。 |
| Zephyr 7B | October 2023 | 利用 dDPO 与 AI 反馈(AIF)偏好数据,在聊天语言建模中实现更优的意图对齐。 |
| Grok 1 | November 2023 | 314B 混合专家模型,仿照《银河系漫游指南》风格设计,机智幽默。 |
| Orca 2 | November 2023 | 提出谨慎推理(Cautious Reasoning):训练小模型根据问题选择最有效的解题策略——为每个任务按所选策略编写任务特定的系统指令以获取教师回答,再将学生的系统指令替换为不含解题细节的通用指令。 |
| Tulu v2 | November 2023 | Tulu 的更新版,覆盖从更优基座模型到新微调技术的指令微调开源资源。 |
| Phi-2 | December 2023 | 2.7B 模型,探索大规模语言模型的涌现能力是否也能通过数据选择等训练策略在小规模上实现。 |
| TinyLlama | January 2024 | 1.1B 语言模型,基于 Llama 2 的架构与分词器,在约 1 万亿词元上预训练约 3 个 epoch,利用 FlashAttention 与分组查询注意力提升计算效率。 |
| Mixtral 8x7B | January 2024 | 稀疏混合专家语言模型,在多语言数据上训练,上下文长度 32k 词元。 |
| H2O Danube 1.8B | January 2024 | 在 1T 词元上训练的语言模型,遵循 LLama 2 与 Mistral 的核心原则,并改进了大模型预训练的多种技术。 |
| OLMo | February 2024 | 真正开源的先进语言模型与框架,包含训练数据、代码与构建、研究、推进语言模型的工具。 |
| MobileLLM | February 2024 | 结合多种架构与注意力机制构建强基线网络,再引入即时分块权重共享方法进一步提升精度。 |
| Orca Math | February 2024 | 微调的 Mistral-7B,无需外部工具即可出色解决数学问题;使用多智能体协作生成的高质量 20 万合成问题数据集,并通过迭代学习(练习解题、接收反馈、从包含模型解答与反馈的偏好对中学习)训练。 |
| Gemma | February 2024 | 基于 Google Gemini 模型的 2B 与 7B 系列先进语言模型,在语言理解、推理与安全性上有所提升。 |
| Aya 101 | Februray 2024 | 大规模多语言生成式语言模型,可遵循 101 种语言的指令,通过微调 mT5 训练得到。 |
| Nemotron-4 15B | February 2024 | Nvidia 训练的 15B 多语言语言模型,训练数据为 8T 文本词元。 |
| Hawk, Griffin | February 2024 | 提出真实门控线性循环单元(Real Gated Linear Recurrent Unit)层,作为新循环模块的核心,替代多查询注意力以提升效率与可扩展性。 |
| WRAP | March 2024 | 使用现成的指令微调模型,按特定风格改写网页文档,在真实与合成改写文本上联合预训练大模型。 |
| Command R | March 2024 | 面向检索增强生成与工具使用的多语言优化大模型。 |
| DBRX | March 2024 | 132B 开源通用细粒度稀疏 MoE 大模型,超越 GPT-3.5,可与 Gemini 1.0 Pro 竞争。 |
| Grok 1.5 | March 2024 | Grok 的升级版,支持最长 128k 词元的长上下文理解与高级推理。 |
| Command R+ | April 2024 | Command R+ 的后继者,在检索增强生成与工具使用方面性能更优,支持多语言。 |
| Llama 3 | April 2024 | 8B 与 70B 参数的模型系列,在 15T 词元上训练,注重数据质量,在多项基准上达到先进性能,推理能力有所提升。 |
| Mixtral 8x22B | April 2024 | 开源权重 AI 模型,为性能与效率优化:多语言流利、数学与代码能力强、可从长文档中精确召回信息。 |
| CodeGemma | April 2024 | 基于 Gemma 的开放代码模型,在超 5000 亿主要为代码的词元上继续训练得到。 |
| RecurrentGemma | April 2024 | 基于 Griffin,用线性循环与局部注意力的组合替代全局注意力,高效建模长序列。 |
| Rho-1 | April 2024 | 提出选择性语言建模:仅在符合目标分布的词元上优化损失,利用参考模型对词元打分并筛选。 |
| Phi-3 | April 2024 | 一系列语言模型,在经过严格过滤的网页与合成数据上训练,性能可媲美 Mixtral 8x7B、GPT-3.5 等大得多的模型。 |
| Open ELM | April 2024 | 完全开源的语言模型,以更少参数与预训练词元提升精度;采用逐层缩放策略,早期层维度较小,后期层逐步扩大。 |
| H2O Danube2 1.8B | April 2024 | 原始 H2O-Danube 模型的更新版:移除滑动窗口注意力、更换分词器、调整训练数据,性能显著提升。 |
| MAmmoTH 2 | May 2024 | 在新范式下精选的数据集上微调的大模型:从预训练网页语料中高效挖掘 1000 万自然存在的指令数据以增强大模型推理能力,流程包括召回相关文档、抽取指令-回答对,并用开源大模型优化抽取结果。 |
| Granite Code Models | May 2024 | 代码模型家族,参数规模 3B 到 34B,在 116 种编程语言的 3.5–4.5T token 代码上训练。 |
| Codestral 22B | May 2024 | 专为代码生成任务设计的开权重模型,在 80 多种编程语言上训练,采用 Mistral AI 非生产许可证,允许开发者用于研究与测试。 |
| Aya 23 | May 2024 | 支持 23 种语言的多语言语言模型家族,预训练时向更少语言分配更多容量,以兼顾广度与深度。 |
| Gemma 2 | June 2024 | 采用交错局部-全局注意力与分组查询注意力,以知识蒸馏替代下一 token 预测进行训练,性能可与更大模型媲美。 |
| Orca 3 (Agent Instruct) | June 2024 | 通过生成式教学微调的 Mistral-7B:AgentInstruct 框架以文本文档、代码文件等原始数据源为种子,生成合成数据(同时生成提示与回答)。 |
| Nemotron-4 340B | June 2024 | Nvidia 的 340B 模型及配套奖励模型,适用于生成合成数据以训练更小的语言模型;模型对齐所用数据中超过 98% 为合成生成。 |
| Mathstral | July 2024 | 基于 Mistral 7B 的 7B 模型,专为数学推理与科学发现设计,深耕 STEM 领域。 |
| Mistral Nemo | July 2024 | Mistral 与 NVIDIA 合作打造的 12B 语言模型,上下文窗口 128K,分词器高效,并采用量化感知训练,可实现无损 FP8 推理。 |
| Smol LM | July 2024 | 小模型家族(135M、360M、1.7B 参数),采用分组查询注意力(GQA)、嵌入共享与 2048 token 上下文,在新的开源高质量数据集上训练。 |
| Llama 3.1 | July 2024 | 多语言语言模型家族,参数规模 8B 到 405B,在 15T token 的大规模数据集上训练,在多项任务上性能与 GPT-4 等领先模型相当。 |
| Llama 3.1 - Multimodal Experiments | July 2024 | 为 Llama 3 添加多模态能力的补充实验。 |
| Mistral Large 2 | July 2024 | 123B 模型,在代码生成、数学与推理能力上有显著提升,支持高级函数调用、128k 上下文窗口,支持数十种语言与 80 多种编程语言。 |
| Minitron | July 2024 | 对现有 Nemotron 模型做剪枝并用一小部分原始训练数据重新训练,压缩倍率达 2–4 倍,计算成本节省最高 40 倍,且在多项语言建模任务上性能提升。 |
| H2O Danube 3 | July 2024 | 4B 与 500M 语言模型系列,在高质量 Web 数据上分三阶段(不同数据配比)训练,随后微调出对话版本。 |
| LLM Compiler | July 2024 | 专为代码优化任务设计的预训练模型套件,基于 Code Llama,有 7B 与 13B 两种规模,在 LLVM-IR 与汇编代码上训练,可优化编译器中间表示、汇编/反汇编,在优化代码体积和将 x86_64、ARM 汇编反汇编回 LLVM-IR 上达到高准确率。 |
| Apple Intelligence Foundation Language Models | July 2024 | 两个基础语言模型——AFM-on-device(约 3B 参数端侧模型)与 AFM-server(更大的服务端模型),高效、准确、负责任地驱动 Apple Intelligence 功能,遵循负责任 AI 原则,优先考虑用户赋能、代表性、设计关怀与隐私保护。 |
| Hermes 3 | August 2024 | 中立的通用指令与工具使用模型,由 Llama 3.1 微调而来,具备强推理与创造能力,设计上以中立态度遵循提示,不做道德评判或表达个人观点。 |
| Smol LM v0.2 | August 2024 | SmolLM 的改进版,更善于紧扣主题并恰当回应标准提示,如问候以及关于其 AI 助手身份的提问。 |
| Phi-3.5 | August 2024 | 模型家族,包含三个变体——MoE(16x3.8B)、mini(3.8B)、vision(4.2B),轻量、多语言,在合成数据与过滤后的公开文档上训练,专注于极高质量、推理密集的数据。 |
| Minitron Approach in Practice | August 2024 | 将 Minitron 方法应用于 Llama 3.1 8B 与 Mistral-Nemo 12B,并引入教师修正以对齐新的数据分布。 |
| OLMoE | September 2024 | 基于稀疏混合专家架构的开源语言模型,7B 参数中每个 token 仅激活 1B 参数。对 MoE 训练做了大量实验,分析路由策略、专家专业化,以及路由算法、专家规模等设计选择的影响。 |
| o1 | September 2024 | 用强化学习训练的大语言模型,回答前先思考,回应前生成长篇内部思维链。 |
| o1-mini | September 2024 | 高性价比的推理模型,擅长 STEM(尤其数学与代码),在评测基准上性能接近 OpenAI o1。 |
| Llama 3.1-Nemotron-51B | September 2024 | 用知识蒸馏与 NAS 针对多种约束优化,推理速度比参考模型快 2.2 倍且精度几乎不变;采用不规则块结构,缩减或剪除注意力与 FFN 层,以更好利用 H100 并优化推理。 |
| Mistral Small | September 2024 | 22B 模型,相比前代在人类对齐、推理能力与代码能力上有显著提升。 |
| Llama 3.2 | September 2024 | 中小型视觉大模型(11B、90B)以及轻量纯文本模型(1B、3B)。 |
| Ministral | October 2024 | 3B 与 8B 模型,支持最高 128k 上下文,采用特殊的交错滑动窗口注意力模式,推理更快、内存更高效。 |
| Quantized Llama 3 | October 2024 | Llama 的优化版本,采用量化感知训练结合 LoRA 适配器与 SpinQuant 等技术,在保持准确率与性能的同时减小模型体积与内存占用,可部署在手机等资源受限设备上。 |
| Nemotron-Mini-Hindi | October 2024 | 基于 Nemotron-Mini 4B 的双语语言模型,针对印地语与英语性能专门训练,在 400B 真实与合成 token 上做持续预训练。 |
| Smol LM v2 | November 2024 | 语言模型家族(135M、360M、1.7B 参数),分别在 2T、4T、11T token 上训练,数据包括 FineWeb-Edu、DCLM、The Stack 以及精选的数学与代码数据集;指令微调版本用 Smol Talk 数据集构建,并用 UltraFeedback 做 DPO。 |
| Tulu V3 | November 2023 | 基于 Llama 3.1 的后训练模型家族,性能超越其他模型的指令版本,包括 GPT-4o-mini、Claude 3.5-Haiku 等闭源模型;训练方法包括监督微调、直接偏好优化与可验证奖励强化学习。 |
| Llama3.3 | December 2024 | 多语言指令微调生成式语言模型,70B 参数,针对对话场景优化,在 15 万亿 token 公开数据上训练,结合人工与合成数据做安全与质量控制。 |
| Command R 7B | December 2024 | R 系列面向企业的大模型中最小、最快、最新的收官之作。上下文长度 128k,集多语言支持、引文可验证的检索增强生成(RAG)、推理、工具使用与智能体行为于一身。 |
| Phi-4 | December 2024 | 14B 语言模型,训练过程强调数据质量:预训练与中期训练用合成数据、精选有机数据种子,以及创新的后训练技术(如用于 DPO 的关键 token 搜索);在推理类基准(尤其 STEM)上表现强劲,可与大得多的模型媲美,同时处理了过拟合与数据污染问题。 |
| ModernBERT | December 2024 | 现代化的纯编码器 Transformer 模型,在 2 万亿 token 上训练,原生序列长度 8192,融入 GeGLU 激活、RoPE 嵌入、交替注意力、去填充等架构改进,在多种分类与检索任务(含代码)上达到 SOTA,且推理速度与内存效率优于现有编码器模型。 |
| OLMo 2 | January 2025 | 开源语言模型家族,改进了架构、训练配方与预训练数据配比;通过后期课程训练引入新的专用数据配比(Dolmino Mix 1124),并借鉴 Tülu 3 的最佳实践打造 OLMo 2-Instruct。 |
| Mistral Small 3 | January 2025 | 延迟优化的 24B 参数语言模型,高效处理需要强语言理解与指令遵循能力的常见生成式 AI 任务。 |
| o3-mini | January 2025 | 高性价比的推理模型,擅长 STEM 领域且保持低延迟;支持函数调用、结构化输出、开发者消息等特性,并提供可调的推理强度(低/中/高)以优化性能。 |
| It's All in The MASK | February 2025 | 提出 ModernBERT-Large-Instruct,一个 0.4B 参数的纯编码器模型,用其掩码语言建模(MLM)头做生成式分类,在分类与知识任务的零样本性能上表现强劲,可与更大的大模型比肩。 |
| AceCoder | February 2025 | 用自动化的大规模测试用例合成,通过强化学习增强代码模型训练。构建问题与测试用例数据集(AceCode-89K),用通过率训练奖励模型(AceCode-RM),再用这些奖励模型与测试用例通过奖励做强化学习,在多项基准上显著提升代码生成性能。 |
| Grok 3 | February 2025 | 以 10 倍于前代的算力大规模训练,具备高级推理能力与 100 万 token 上下文窗口,有 "Think" 模式,并提供面向 STEM 任务的高性价比 "mini" 版本。DeepSearch 等 Grok 智能体结合推理与联网、代码解释器等工具使用,进一步增强其能力。 |
| Mistral Saba | February 2025 | 24B 参数的区域语言模型,专注中东与南亚语言(尤其阿拉伯语及泰米尔语等南印度语言),在区域准确性与相关性上超越大得多的模型,且延迟更低。 |
| Phi 4 Mini | February 2025 | 3.8B 参数语言模型,擅长数学与代码,采用高质量 Web 与合成数据,词表 200K token,带分组查询注意力。 |
| NeoBERT | February 2025 | 新一代编码器模型,融合架构、数据与预训练策略的进展;深度-宽度比最优,上下文长度扩展到 4096 token,仅 250M 参数,且完全开源(代码、数据、训练脚本、模型权重均已发布)。 |
| GPT-4.5 | February 2025 | 研究预览模型,代表无监督学习规模化的新进展:通过算力、数据、架构与优化创新带来更广的知识、更深的理解、更少的幻觉与更高的可靠性。得益于从小模型提炼出的新可扩展训练技术,它在自然对话、创意与理解人类意图的任务上表现突出。 |
| Gemma 3 | March 2025 | 多模态语言模型,具备视觉理解能力,语言覆盖更广,上下文(128k token)比前代更长;采用改进架构,增加局部注意力以降低 KV 缓存内存需求,用蒸馏训练,并采用新的后训练配方,在数学、对话、多语言等任务上提升性能。 |
| Command A | March 2025 | 1110 亿参数的开权重研究发布模型,专为业务关键的智能体与多语言任务优化;上下文长度 256K,在 23 种语言上训练,专为 RAG 与工具使用设计,两者均提供可验证引文。 |
| GPT-4.1 | April 2025 | 先进语言模型,在代码、指令遵循与长上下文理解(最高 100 万 token)上超越前代,成本与延迟更低,在真实任务中表现优异,视觉能力也有增强。 |
| o3 | April 2025 | 推理模型,擅长需要多方面分析的复杂任务,尤其涉及图像、图表等视觉数据的任务;调用网页搜索、代码执行、图像生成等工具给出全面回答,在多项基准与真实任务上显著提升。 |
| o4-mini | April 2025 | 更小、更快、更具性价比的推理模型,为速度与效率优化;在数学、代码与视觉任务上表现强劲,其他领域同样出色,因效率支持更高使用上限,适合高并发应用。 |
| Phi-4-Reasoning | April 2025 | Phi-4-reasoning 及其 RL 增强版 Phi-4-reasoning-plus,是小而强的推理模型,在 o3-mini 生成的复杂提示与演示精选数据集上训练;在 STEM、代码、算法解题等多种推理任务上表现强劲,常超越更大的模型,并提供准确率/ token 长度的权衡。 |
| Phi-4-Mini-Reasoning | April 2025 | 3.8B 参数语言模型,采用四步训练流程:蒸馏长 CoT 数据的大规模中期训练与监督微调、Rollout DDPO、可验证奖励强化学习;在数学推理任务上超越更大的推理模型,证明该训练配方能让小模型具备强推理能力。 |
| OpenCodeReasoning | April 2025 | 公开数据集,包含 736,712 个 Python 代码解法及附带推理轨迹,覆盖 28,904 道由 DeepSeek-R1 生成的独特竞赛编程题目,旨在通过 SFT 增强大模型在代码任务上的推理能力。 |
| UltraLong | April 2025 | 提出一种训练方法,开发上下文窗口长达 400 万 token 的超长上下文大模型:先用基于 YaRN 的缩放做高效持续预训练,再做指令微调。 |
| Llama-Nemotron | May 2025 | 开源异构推理模型家族(Nano 8B、Super 49B、Ultra 253B),推理能力出色且推理高效;用神经架构搜索、知识蒸馏、持续预训练、监督微调与强化学习训练,提供动态推理开关,可在标准对话与详细推理模式间切换。 |
| Mistral Medium 3 | May 2025 | 高性价比的语言模型,专为企业场景设计,性能与 Claude Sonnet 3.7 相当但成本低 8 倍,擅长代码、STEM 等专业任务。 |
| Gemma 3n | May 2025 | 针对端侧优化的模型,采用 PLE 缓存、MatFormer 架构等创新,实现高效性能。 |
| Devstral | May 2025 | 面向软件工程任务的智能体大模型,由 Mistral AI 与 All Hands AI 合作开发,基于 Mistral-Small-3.1 微调。 |
| Sarvam - M | May 2025 | 基于 Mistral Small 的大语言模型,经监督微调(SFT)、可验证奖励强化学习(RLVR)与推理优化增强,专注印度语言及数学、编程等推理任务。 |
| Sarvam - Translate | June 2025 | 微调 Gemma3–4B-IT 得到的翻译模型,支持 22 种印度语言——印地语、孟加拉语、马拉地语、泰卢固语、泰米尔语、古吉拉特语、乌尔都语、卡纳达语、奥里亚语、马拉雅拉姆语、旁遮普语、阿萨姆语、迈蒂利语、桑塔利语、克什米尔语、尼泊尔语、信德语、多格拉语、孔卡尼语、曼尼普尔语(梅泰语)、博多语、梵语。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Wizard Math | August 2023 | 提出基于 Evol-Instruct 反馈的强化学习(RLEIF)方法,应用于 Llama-2 以增强数学推理能力。 |
| MAmmoTH | September 2023 | 专为通用数学问题求解设计的大模型系列,在 MathInstruct 数据集上训练;该数据集从 13 个数学数据集中汇编,带中间推理过程,结合思维链与程序思维两种方法,以适应不同数学问题的思维过程。 |
| MetaMath | September 2023 | 专注数学推理的微调语言模型:从多个角度自举数学问题,无需额外知识,再在所得数据集上微调 LLaMA-2。 |
| ToRA | September 2023 | 将自然语言推理与外部工具无缝结合的大语言模型系列,用于求解复杂数学问题。 |
| Math Coder | October 2023 | 首个将自然语言推理、代码生成与执行结果反馈显式整合进开源预训练大模型的系统性研究。 |
| MuggleMath | October 2023 | 用查询增强与回答增强扩增 GSM8K 与 MATH 数据集,以微调 Llama 2 模型。 |
| Llemma | October 2023 | 数学大语言模型,由 Code Llama 在科学论文、含数学的 Web 数据与数学代码的混合数据上持续预训练得到。 |
| MuMath | December 2023 | 数学多视角增强数据集,融合无工具方法的优势,拓宽增强技术范围以提升数学推理能力。 |
| Math Shepherd | December 2023 | 过程奖励模型,自动为数学解题每一步打分,据此对大模型输出重排序,并通过逐步 PPO 强化大模型,无需人工标注或外部工具;采用受蒙特卡洛树搜索启发的方法——从每一步解码多条后续路径,该步得分反映其中通向正确答案的比例。 |
| MMIQC | January 2024 | 采样 Meta Math、迭代问题组合、利用 Stack Exchange、相似问题增强、答案增强与问题自举,整理数据集以微调 Mistral、Llemma、DeepSeek 与 Qwen。 |
| DeepSeek Math | February 2024 | 数学语言模型,采用近端策略优化(PPO)变体——组相对策略优化(GRPO),不依赖外部工具包或投票技术。 |
| Open Math Instruct 1 | February 2024 | 数学指令微调数据集,含 180 万代码解释器风格的题解对(GSM8K 与 MATH),由 Mixtral 生成。 |
| Math Orca | February 2024 | 微调的 Mistral-7B,无需外部工具即可擅长数学题;使用 20 万道问题的高质量合成数据集,数据由多智能体协作生成,并经迭代学习流程——练习解题、接收反馈、从融合模型解法与反馈的偏好对中学习。 |
| Math Genie | February 2024 | 通过迭代扩增小规模题解数据集并回译,生成多样且可靠的数学问题,再生成并验证代码集成解法的框架。 |
| Xwin-Math | March 2024 | 用数据合成将 GSM 8K 与 MATH 数据集扩增到 144 万道问题,再在整理后的数据集上微调 Llama 2、Mistral、Llemma。 |
| MuMath Code | May 2024 | 在含代码嵌套解法的数学问题数据集上微调 Llama-2,融合工具使用与数据增强。 |
| Skywork-Math | July 2024 | 7B 参数大模型系列,仅在新数据集 Skywork-MathQA(250 万样本)上微调;该数据集通过新颖的两阶段流水线生成,采用多样种子问题并增强难题。 |
| Numina Math | July 2024 | 首届 AIMO 进展奖冠军,基于 DeepSeek Math,分两阶段微调:CoT 与 ToRA。 |
| Qwen 2 Math | August 2024 | 专注数学能力的模型系列,基于 Qwen2,在数学相关任务上超越 GPT-4o、Claude 3.5 等专有模型。 |
| Qwen 2.5 Math | September 2024 | Qwen 2 Math 系列的升级版,性能提升并扩展支持工具集成推理。 |
| Open Math Instruct 2 | October 2024 | 数学指令微调数据集,含 1400 万问答对(约 60 万独特问题),由 GSM8K 与 MATH 数据集扩增而来,用 Llama 3.2 405B 生成。 |
| Math Coder 2 | October 2024 | 过滤 Web 数据构建 Math Code Pile,再从中提取并转译数学数据,形成交错推理与代码的语料。 |
| AceMath | December 2024 | 数学指令遵循模型套件,经两阶段 SFT(通用推理与数学专用推理)训练,采用高质量合成数据与专用奖励模型(AceMath-RM,以多样回答训练)。 |
| s1 | January 2025 | 提出新的测试时扩展方法:在精选的 1000 样本数据集(s1K,含推理轨迹的多样难题)上做监督微调即获得强推理性能,并用"预算强制"通过限制或延长模型思考过程来控制测试时算力。 |
| LIMO | February 2025 | 挑战"复杂推理需要海量数据"的观念:仅用 817 个精选训练样本、强调高质量推理链,就在数学推理基准上达到 SOTA。 |
| MathFusion | March 2025 | 新颖框架,用顺序、并行、条件三种融合策略从现有题目合成新题,捕捉数学知识中的关系结构,从而提升大模型的数学推理能力。 |
| OpenMath Nemotron | April 2025 | 数学推理模型系列(1.5B、7B、14B、32B 参数),包含 AI 数学奥林匹克进展奖 2(AIMO-2)的获奖方案;在 54 万道独特数学题、320 万解法的大规模数据集(OpenMathReasoning)上训练,支持带 Python 代码执行的 CoT 与 TIR。 |
| Nemotron CrossThink | April 2025 | 用强化学习提升大模型超越数学的多样任务推理能力的框架:引入多领域数据(STEM、人文、社科等)与多格式(选择题、开放题)及可验证答案,优化数据混合策略以有效训练。 |
| ThinkPRM | April 2025 | 生成式 PRM,用长 CoT 推理过程逐步验证解法;在少量合成数据上训练,在多项推理任务与验证场景中超越以远更多数据训练的判别式 PRM 和 LLM-as-a-Judge 基线。 |
| RM-R1 | May 2025 | 生成式奖励模型家族(推理奖励模型),把奖励建模表述为推理任务,提升可解释性与性能;经面向推理的流水线训练(结构化推理蒸馏 + 可验证奖励强化学习),RM-R1 生成推理轨迹或对话专用评分细则来评估候选回答。 |
| Fathom R1 | May 2025 | 14B 参数推理语言模型,源自 Deepseek-R1-Distilled-Qwen-14B,在精选数据集上做监督微调(SFT)并做模型合并训练;模型、后训练配方与数据集均已开源。 |
| AceReason-Nemotron | May 2025 | 证明大规模强化学习能显著增强强中小模型的推理能力:先在纯数学提示上训练,再在纯代码提示上训练。 |
| Magistral | June 2025 | Mistral AI 首个推理模型,分开源版(Magistral Small,24B 参数)与企业版(Magistral Medium),为业务战略、受监管行业、软件工程等场景提供领域特定、透明、多语言的推理。 |
| AceReason-Nemotron 1.1 | June 2025 | 利用 SFT 与 RL 的协同:扩大 SFT 训练数据,在 RL 训练中精心选择采样温度以平衡探索与利用,并对纯数学、纯代码提示做分阶段 RL。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Florence | November 2021 | 一种计算机视觉基础模型,可通过将表示从粗粒度(场景)扩展到细粒度(物体)、从静态(图像)扩展到动态(视频)、从 RGB 扩展到多模态,来适配各种任务。 |
| BLIP | February 2022 | 一种视觉-语言预训练(VLP)框架,引入了多模态编码器-解码器混合(MED)以及 Captioning and Filtering(CapFilt)——一种从带噪音的图文对中学习的新数据集自举方法。 |
| Flamingo | April 2022 | 视觉语言模型,能够无缝处理交错的视觉与文本数据,并便于在大型网页语料上进行少样本学习。 |
| PaLI | September 2022 | 一种联合语言-视觉模型,可基于视觉与文本输入生成多语言文本;使用大型预训练编码器-解码器语言模型和视觉 Transformer(具体为 mT5 和 ViT-e)训练。 |
| BLIP 2 | January 2023 | 一种视觉-语言预训练(VLP)框架,提出了 Q-Former——一个可训练模块,用于桥接冻结的图像编码器与冻结的 LLM,以自举视觉-语言预训练。 |
| LLaVA 1 | April 2023 | 连接 CLIP 和 Vicuna 的大型多模态模型,在 GPT-4 从图文对生成的指令遵循数据上端到端训练。 |
| PaLI-X | May 2023 | 多语言视觉与语言模型,组件规模扩大(具体为 ViT-22B 和 UL2 32B),展现出复杂计数和多语言目标检测等涌现能力,并在多项任务上表现更好。 |
| InstructBLIP | May 2023 | 引入指令感知的 Query Transformer,提取与给定指令相关的信息特征,用于研究基于预训练 BLIP-2 模型的视觉-语言指令微调。 |
| Idefics | June 2023 | 在 Obelics 上训练的 90 亿和 800 亿参数多模态模型;Obelics 是本工作中整理出的开放的网页级图文交错文档数据集。 |
| GPT-4V | September 2023 | 结合文本与视觉能力的多模态模型,用户可指示其分析图像输入。 |
| PaLI-3 | October 2023 | 基于 20 亿参数 SigLIP 视觉模型和 UL2 30 亿参数语言模型的 50 亿参数视觉语言模型,在多项基准上超越更大的模型;尽管未在任何视频数据上预训练,仍在多个视频问答基准上达到 SOTA。 |
| LLaVA 1.5 | October 2023 | LLaVA 模型的增强版,引入 CLIP-ViT-L-336px 和 MLP 投影层,以及面向学术任务的 VQA 数据,在大型多模态模型(LMM)研究中树立了新基准。 |
| Florence-2 | November 2023 | 视觉基础模型,对多种计算机视觉和视觉-语言任务采用统一的、基于提示的表示方式。 |
| CogVLM | November 2023 | 通过在注意力和 FFN 层中引入可训练的视觉专家模块,桥接冻结的预训练语言模型与图像编码器。 |
| Gemini 1.0 | December 2023 | 在图像、音频、视频和文本数据上联合训练的高能力多模态模型家族,旨在构建跨模态的强通用能力模型。 |
| MoE-LLaVA | January 2024 | 基于 MoE 的稀疏 LVLM 框架,在部署时仅通过路由器激活 top-k 专家,在保持计算效率的同时达到与更大模型相当的性能。 |
| LLaVA 1.6 | January 2024 | LLaVA 1.5 的改进版,推理、OCR 和世界知识能力更强,图像分辨率更高。 |
| Gemini 1.5 Pro | February 2024 | 高计算效率的多模态混合专家模型,在长上下文检索任务以及文本、视频、音频模态理解上表现优异。 |
| Claude 3 | March 2024 | 由 Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus 组成的 VLM 家族,为认知任务树立了新的行业标准,在智能、速度和成本效率上各有侧重。 |
| MM1 | March 2024 | 结合 378x378px 分辨率的 ViT-H 图像编码器的多模态 LLM,在图文文档和纯文本文档混合数据上预训练,参数规模扩展到 3B、7B 和 30B,以提升多项任务的性能。 |
| Grok 1.5 V | April 2024 | Grok 系列的第一个多模态模型。 |
| Idefics2 | April 2024 | 在 Idefics1 基础上的改进,OCR 能力更强、架构更简化、预训练骨干更好,在公开数据集的混合数据上训练,并在面向任务的数据上微调。 |
| Phi 3 Vision | May 2024 | Phi 家族的第一个多模态模型,具备对图像进行推理以及从图像中提取并推理文本的能力。 |
| An Introduction to Vision-Language Modeling | May 2024 | 全面介绍 VLM 的定义、功能、训练方法和评估方法,旨在帮助研究者和实践者进入该领域,推动 VLM 在各种应用中的发展。 |
| GPT-4o | May 2024 | 全模态模型,可接受并生成多种类型的输入输出,包括文本、音频、图像和视频。 |
| Gemini 1.5 Flash | May 2024 | Gemini 1.5 Pro 的轻量变体,为效率设计,质量回退极小,适合计算资源有限的应用场景。 |
| Chameleon | May 2024 | 早期融合的基于 token 的混合模态模型家族,能够以任意顺序理解和生成图像与文本。 |
| Claude 3.5 Sonnet | June 2024 | 在智能、速度和成本效率上超越前代及竞争对手,在研究生级推理、本科级知识、编码能力和视觉推理上表现优异。 |
| Pali Gemma | July 2024 | 结合 SigLIP 视觉模型和 Gemma 语言模型,沿用 PaLI-3 的训练流程,在多项视觉-语言任务上表现强劲。 |
| GPT-4o mini | July 2024 | 成本高效的小模型,在对话偏好上超越 GPT-4,支持文本、视觉和多模态输入输出,延迟低,可胜任广泛的任务。 |
| Grok 2 | August 2024 | 前沿语言模型,在对话、编码和推理上达到 SOTA,与 Claude 3.5 Sonnet 和 GPT-4-Turbo 相当。 |
| BLIP-3 (xGen-MM) | August 2024 | 开发大型多模态模型的综合系统,包括精选数据集、训练流程、模型架构和预训练模型,展现出强大的上下文学习能力,并在多项任务上具有竞争力的表现。 |
| Idefics 3 | August 2024 | 基于 Llama 3.1 和 SigLIP-SO400M 的 VLM,仅使用开放数据集和简单流程高效训练,在文档理解任务上显著超越。 |
| CogVLM2 | August 2024 | 支持图像和视频理解的视觉语言模型家族,采用改进的训练流程,探索增强的视觉-语言融合、更高的输入分辨率以及更广泛的模态和应用。 |
| Eagle | August 2024 | 深入探索使用视觉编码器与分辨率混合的 MLLM 设计空间,揭示多种现有策略共有的底层原理,得到精简而有效的设计方法。 |
| Pixtral | September 2024 | 120 亿参数的原生多模态视觉-语言模型,在图文交错数据上训练,在多模态任务上表现强劲,指令遵循能力突出。 |
| NVLM | September 2024 | 多模态大语言模型家族,比较了仅解码器多模态 LLM 与基于交叉注意力的模型,并提出了混合架构;还引入了面向瓦片式动态高分辨率图像的一维标题标签设计。 |
| Molmo | September 2024 | 开放权重的视觉-语言模型家族,利用新颖的人工标注图像描述数据集 PixMo,达到 SOTA 性能。 |
| MM-1.5 | September 2024 | 多模态大语言模型家族,旨在增强富文本图像理解、视觉指代与定位以及多图推理能力,通过以数据为中心的方法实现——多样的数据混合,以及面向视频和移动 UI 理解的专用变体。 |
| Mississippi | October 2024 | 基于 Danube 构建的小型、高效、开源的视觉-语言模型集合,在 3700 万图文对上训练,专为文档分析和 OCR 任务设计,同时在通用视觉-语言基准上保持强劲性能。 |
| Claude 3.5 Haiku | October 2024 | 快速且经济的语言模型,在编码、推理和内容创作等任务上表现优异。 |
| Pixtral Large | November 2024 | 1240 亿参数的开放权重多模态模型,基于 Mistral Large 2 和 10 亿参数视觉编码器,擅长理解文档、图表和自然图像;支持 128K token 上下文窗口,可容纳至少 30 张高分辨率图像。 |
| Smol VLM | November 2024 | 20 亿参数的视觉-语言模型,采用改进的 Idefics3 架构,语言骨干更小(SmolLM2 1.7B),激进的像素重排压缩、384x384 图像块和形状优化的 SigLIP 视觉骨干,上下文窗口为 16k token。 |
| MAmmoTH-VL | December 2024 | 整理出大规模多模态指令微调数据集,包含 1200 万指令-回复对;方法成本较低:收集并分类开源数据、针对特定任务用开放模型做数据增强和改写(描述类数据用 Llama-3-70B-Instruct,其他数据用 InternVL2-Llama3-76B),并用 InternVL2-Llama3-76B 自过滤以去除幻觉、保证数据质量。 |
| Maya | December 2024 | 开源多语言多模态模型,旨在提升八种语言(英语、中文、法语、西班牙语、俄语、印地语、日语和阿拉伯语)的视觉-语言理解能力;基于 LLaVA 新建了经毒性过滤的多语言图文数据集,引入 SigLIP 视觉编码器和 Aya-23 8B 语言模型,并在 PALO 150K 指令微调数据集上微调。 |
| Gemini 2.0 Flash | December 2024 | 比前代更快、更强的大语言模型,多模态输入输出增强(包括原生图像生成和可控的多语言音频)、原生工具使用(如 Google Search 和代码执行),并通过改进的推理和复杂指令遵循能力带来新一类智能体体验。 |
| Llava-Mini | January 2025 | 高效的大型多模态模型,将 CLIP 视觉编码器的视觉信息预先融合到文本 token 中,再连同少量压缩后的视觉 token(通过基于查询的压缩获得)送入 LLM 骨干,从而最小化视觉 token 数量;大幅减少 LLM 需处理的 token 数,同时保留视觉理解能力,可高效处理标准及高分辨率图像和视频。 |
| Kimi k1.5 | January 2025 | 用强化学习(RL)训练的多模态 LLM,聚焦长上下文扩展和改进的策略优化,在多项基准和模态上达到 SOTA 推理性能;在长上下文任务上媲美 OpenAI 的 o1,并通过有效的 long2short 上下文压缩方法显著超越 GPT-4o 和 Claude Sonnet 3.5 等短上下文模型。 |
| Eagle 2 | January 2025 | 高性能视觉-语言模型(VLM)家族,从零构建后训练数据策略,聚焦数据收集、过滤、选择和增强,并采用以视觉为中心的架构设计(瓦片式视觉编码器混合)和三阶段训练流程。 |
| Aya Vision | February 2025 | 开放权重的 80 亿和 320 亿参数多语言视觉-语言模型(VLM)家族,支持 23 种语言,基于 Aya Expanse,融合了合成标注、数据翻译/改写和多模态模型合并等技术。 |
| Phi-4 Multimodal | February 2025 | 通过新颖的 LoRA 混合方法将 Phi-4-Mini 扩展到视觉和语音/音频模态,实现无干扰的联合模态推理,在多项多模态任务上达到 SOTA,同时保持基座语言模型的能力。 |
| Gemini 2.0 Flash Lite | February 2025 | 生产级语言模型,在推理、多模态任务、数学和事实准确性上超越前代(1.5 Flash),定价经济,适合需要长上下文窗口的应用。 |
| Gemini 2.5 Pro | March 2025 | Google 最先进的实验性 AI 模型,推理和编码能力增强,在复杂任务上表现出色,在多项基准上达到 SOTA;延续 Gemini 的原生多模态和长上下文窗口优势。 |
| MAmmoTH-VL 2 | March 2025 | 提出 VisualWebInstruct,一种利用 Google 图片搜索和 LLM(Gemini 和 GPT-4)构建大规模、多样化多模态指令数据集的新方法,约 90 万问答对(40% 为视觉类),聚焦各科学学科的复杂推理;在该数据集上微调现有 VLM 可显著提升推理基准表现。 |
| Mistral Small 3.1 | March 2025 | 基于 Mistral Small 3 的多模态语言模型,文本性能提升,上下文窗口扩展至 128k token。 |
| Gemini 2.5 Flash | April 2025 | 混合推理模型,开发者可控制"思考"过程以提升复杂任务的准确性,提供可定制的思考预算,在质量、成本和速度之间权衡。 |
| Claude 4 | May 2025 | 混合模型,提供两种模式:近乎即时的响应和用于深度推理的扩展思考,在编码、高级推理和 AI 智能体方面树立新标准。 |
| Eagle 2.5 | April 2025 | 面向长上下文多模态学习的视觉-语言模型家族,通过通用框架解决长视频理解和高分辨率图像理解的挑战;引入自动退化采样、图像区域保留、效率优化以及 Eagle-Video-110K 数据集,在长上下文多模态基准上大幅提升。 |
| PerceptionLM | April 2025 | 开放且可复现的图像与视频理解研究框架,解决闭源 VLM 的局限以及从专有模型蒸馏的问题。 |
| Gemini 2.5 | June 2025 | Google 下一代 AI 模型,面向智能体系统设计,原生多模态、长上下文输入、支持工具使用;各模型在推理、成本和延迟上各有侧重:Gemini 2.5 Pro 擅长推理和编码,Gemini 2.5 Flash 平衡质量、成本与延迟,Gemini 2.0 Flash 快速且经济,Gemini 2.0 Flash-Lite 最快、最经济。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| SimCLR | February 2020 | 简化的对比学习框架,优化数据增强组合,引入可学习的非线性变换,并利用更大的批次和更多的训练步数。 |
| Dense Passage Retriever | April 2020 | 表明仅用稠密表示即可实际实现检索——通过简单的双编码器框架,从少量问答和段落中学习嵌入。 |
| ColBERT | April 2020 | 引入后期交互架构,使深度语言模型(特别是 BERT)适配高效检索。 |
| SimCLRv2 | June 2020 | 半监督学习框架,先无监督预训练,再用无标注样本进行监督微调和蒸馏。 |
| CLIP | February 2021 | 通过预训练从原始文本-图像对中学习图像表示的视觉系统,可零样本迁移到多种下游任务。 |
| ColBERTv2 | December 2021 | 将激进的残差压缩机制与去噪监督策略结合,同时提升后期交互的质量和空间占用。 |
| Matryoshka Representation Learning | May 2022 | 在不同粒度上编码信息,允许用单个嵌入实现灵活表示,以不同计算资源适配多个下游任务。 |
| E5 | December 2022 | 用对比方式训练的文本嵌入家族,弱监督信号来自整理的大规模文本对数据集 CCPairs。 |
| SigLip | March 2023 | 面向语言-图像预训练的简单成对 Sigmoid 损失函数,仅作用于图像-文本对,允许更大的批次,并在小批次下表现更好。 |
| Jina Embeddings v1 | July 2023 | 在精选的高质量成对和三元组数据上对比微调的 T5 编码器,专门使模型能区分陈述的否定形式与肯定形式。 |
| Jina Embeddings v2 | October 2023 | 开源文本嵌入模型,支持最长 8192 token;从零预训练改进版 BERT,再针对嵌入目标微调。 |
| SynCLR | December 2023 | 视觉表示学习方法,利用生成模型合成大规模精选数据集,不依赖任何真实数据。 |
| E5 Mistral 7B | December 2023 | 利用专有 LLM 生成多样化合成数据,微调开源的仅解码器 LLM,用于数十万文本嵌入任务。 |
| Nomic Embed Text v1 | February 2024 | 1.37 亿参数的开源英文文本嵌入模型,上下文长度 8192,在短上下文和长上下文任务上均超越 OpenAI 的模型。 |
| Nomic Embed Text v1.5 | February 2024 | 先进的文本嵌入模型,利用 Matryoshka 表示学习提供灵活的嵌入维度,性能损失极小。 |
| Jina Bilingual Embeddings | February 2024 | 双语文本嵌入模型套件,支持最长 8192 token;从零预训练改进版双语 BERT,再针对嵌入目标微调。 |
| Jina Reranker | February 2024 | 神经重排序模型,通过重新排序检索到的文档,使其与检索查询词更好地对齐,从而增强搜索和 RAG 系统。 |
| Gecko | March 2024 | 12 亿参数的多功能文本嵌入模型,通过从 LLM 向检索器蒸馏知识,实现强劲的检索性能。 |
| NV Embed | May 2024 | 引入架构创新和训练流程,显著提升 LLM 在通用文本嵌入任务上的表现。 |
| Nomic Embed Vision v1 and v1.5 | June 2024 | 将视觉编码器与现有文本编码器对齐,同时不破坏文本编码器的下游性能,以获得统一的多模态隐空间。 |
| Document Screenshot Embedding | June 2024 | 新颖的检索方法,使用大型视觉-语言模型(如微调后的 Phi-3-vision)将文档截图直接编码为稠密向量,无需内容抽取,保留全部信息(文本、图像、版式),实现跨多种文档格式和模态的统一检索。 |
| ColPali | June 2024 | 基于 PaliGemma 的检索模型,仅从文档页面图像生成高质量的上下文嵌入,并采用后期交互,实现高效、有效的富视觉文档检索。 |
| Jina Reranker v2 | June 2024 | 在 Jina Reranker v1 基础上增加多语言支持、函数调用能力、结构化数据查询、代码检索和超快推理。 |
| E5-V | July 2024 | 将多模态大语言模型适配为通用多模态嵌入的框架,利用提示和在文本对上的单模态训练,无需微调即在多模态嵌入上表现强劲,省去收集昂贵多模态训练数据的需求。 |
| Matryoshka Adaptor | July 2024 | 面向 LLM 嵌入定制的框架,在保持相当性能水平的同时大幅降低维度。 |
| Jina Embeddings v3 | September 2024 | 5.7 亿参数的文本嵌入模型,支持最长 8192 token 的长上下文检索任务,包含面向多种 NLP 任务的 LoRA 适配器,并允许用 Matryoshka 表示学习将输出维度从 1024 灵活降至 32。 |
| vdr Embeddings | January 2025 | 面向视觉文档检索的嵌入模型,在使用 DSE 方法的大规模合成数据集上训练,提升跨语言场景和富视觉文档的检索质量,并支持 Matryoshka 表示学习,以最小性能影响减小向量尺寸。 |
| mmE5 | February 2025 | 多模态多语言 E5 模型,在新颖框架生成的合成数据集上训练,聚焦广泛覆盖(多样任务、模态和 93 种语言)、强跨模态对齐(单次 MLLM 前向内的深度思考过程)和高保真(真实图像、自我评估与精炼)。 |
| SigLIP 2 | February 2025 | 多语言视觉-语言编码器家族,在原版 SigLIP 基础上引入基于描述的预训练、自监督损失(自蒸馏、掩码预测)和在线数据整理,提供多种尺寸(ViT-B/32、B/16、L、So400m、g)和原生宽高比保留(NaFlex 变体)。 |
| Gemini Embedding | March 2025 | 基于 Google 的 Gemini LLM 初始化,利用 Gemini 的知识和经 Gemini 生成的合成数据增强并过滤的精选训练数据集,生成面向多语言文本和代码的通用嵌入。 |
| ReasonIR | April 2025 | 专门面向推理密集型任务的新型双编码器检索器,使用合成数据生成流程构建具有挑战性的查询,配以相关文档和看似相关但无用的困难负样本;在该合成数据和现有公开数据集上训练。 |
| Hard Negative Mining for Domain-Specific Retrieval | May 2025 | 解决企业搜索系统中检索准确的领域特定信息的挑战,通过动态选择语义上有挑战性但上下文无关的文档来改进重排序模型;该方法融合多种嵌入模型,进行降维,并采用独特的困难负样本选择流程,保证计算效率和语义精度。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| LoRA | July 2021 | 在预训练 Transformer 模型的每一层引入可训练的低秩分解矩阵,大幅减少下游任务的可训练参数数量。 |
| DyLoRA | October 2022 | 训练时随机截断低秩矩阵,实现灵活的秩大小,无需重训练即可适配不同的秩值。 |
| AdaLoRA | March 2023 | 基于重要性度量动态分配参数预算,训练时剪除不重要的奇异值。 |
| QLoRA | May 2023 | 通过 4-bit NormalFloat(NF4)、双重量化和分页优化器等创新,在有限的 GPU 显存上高效训练大模型。 |
| LoRA-FA | August 2023 | 冻结其中一个低秩矩阵,仅训练另一个的缩放向量,进一步减少可训练参数(相比标准 LoRA)。 |
| Delta-LoRA | September 2023 | 利用低秩矩阵更新的增量直接精炼预训练权重,并移除 Dropout 层以实现准确的反向传播。 |
| LongLoRA | September 2023 | 为大语言模型实现上下文扩展,通过稀疏局部注意力和参数高效微调显著节省计算。 |
| VeRA | October 2023 | 在所有层共享冻结的随机矩阵,训练缩放向量为每层适配这些矩阵,相比 LoRA 减少可训练参数。 |
| LoRA+ | February 2024 | 为 A 和 B 矩阵按固定比例设置不同的学习率,促进更好的特征学习和性能提升。 |
| MoRA | May 2024 | 引入方阵和无参数算子,以与 LoRA 相同的可训练参数量实现高秩更新,提升知识记忆能力。 |
| DoRA | May 2024 | 将高秩 LoRA 矩阵分解为多个单秩组件,训练时动态剪除不重要的组件,实现更高效的参数预算分配。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Prometheus | October 2023 | 一个 13B 完全开源的评估 LLM,基于通过 GPT-4 精选的 Feedback Collection(本工作)训练而成。 |
| Prometheus 2 | May 2024 | 7B 与 8x7B 评估 LLM,在直接评估和成对排序上与人类评估者及专有 LM 评判者均具有高度相关性,通过合并基于 Feedback Collection 和 Preference Collection(本工作中精选)训练的 Mistral 模型获得。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| LLMLingua | October 2023 | 一种新颖的由粗到细提示压缩方法,包含预算控制器、迭代式词元级压缩算法和分布对齐,可实现高达 20 倍的压缩,同时性能损失极小。 |
| LongLLMLingua | October 2023 | 一种针对长上下文场景的提示压缩新方法,利用问题感知压缩和文档重排来提升性能。 |
| LLMLingua2 | March 2024 | 一种与任务无关的提示压缩新方法,通过数据蒸馏并利用 Transformer 编码器进行词元分类,旨在提升泛化能力。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Vision Transformer | October 2020 | 将图像切分为图块,视作词元,将这些图块线性嵌入后的序列输入 Transformer。 |
| DeiT | December 2020 | 无卷积的视觉 Transformer,采用师生策略与基于注意力的蒸馏词元。 |
| Swin Transformer | March 2021 | 层次化视觉 Transformer,使用移位窗口来解决将 Transformer 适配到计算机视觉的挑战。 |
| Convolutional Vision Transformer | March 2021 | 通过引入卷积改进 ViT 的性能和效率,兼具两种设计的优点。 |
| LeViT | April 2021 | 基于 ViT 架构与 DeiT 训练方法的混合神经网络,用于快速推理的图像分类。 |
| DINO | April 2021 | 研究自监督学习是否为视觉 Transformer 带来了超越卷积网络的新特性,发现自监督 ViT 特征包含关于图像语义分割的显式信息,也是出色的 k-NN 分类器。 |
| BEiT | June 2021 | 借鉴 BERT 的掩码图像建模任务,利用图像图块和视觉词元预训练视觉 Transformer。 |
| MobileViT | October 2021 | 为移动设备设计的轻量视觉 Transformer,有效结合 CNN 与 ViT 的优势。 |
| Masked AutoEncoder | November 2021 | 编码器-解码器架构,通过掩码随机图块并利用高比例掩码进行自监督,重建输入图像。 |
| DINOv2 | April 2022 | 证明现有自监督预训练方法可在多样化精选数据上训练出通用视觉特征,并提出结合多种技术、用更大模型和数据集扩展预训练的新方法。 |
| MaxViT | April 2022 | 引入多轴注意力,在任意输入分辨率上实现全局-局部空间交互,且仅有线性复杂度。 |
| Swin Transformer V2 | April 2022 | Swin Transformer 的后继版本,解决了训练稳定性、分辨率差距和标注数据稀缺等挑战。 |
| EfficientFormer | June 2022 | 通过延迟分析重新审视 ViT 及其变体的设计原则,识别 ViT 中低效的设计与算子,提出新的维度一致设计范式和简单有效的延迟驱动剪枝方法以优化推理速度。 |
| FastViT | March 2023 | 混合视觉 Transformer 架构,引入名为 RepMixer 的新颖词元混合算子,显著提升模型效率。 |
| Efficient Vit | May 2023 | 在高效 FFN 层之间采用单一的内存密集型 MHSA,在增强通道通信的同时提升内存效率。 |
| SoViT | May 2023 | 形状优化的视觉 Transformer,在同等算力预训练下,达到两倍于自身规模模型的竞争性结果。 |
| Autoregressive Image Models (AIM) | January 2024 | 在 20 亿图像上以自回归目标预训练的 80 亿参数视觉模型,类似于大语言模型,通过前缀注意力、参数化预测头等架构改进展现扩展规律。 |
| Autoregressive Image Models V2 (AIM V2) | November 2024 | 参数量从 3 亿到 30 亿的开放视觉编码器家族,将 AIM 框架扩展到图像和文本,以多模态自回归方式预训练,用因果解码器同时生成图像图块和文本词元。 |
| Perception Encoder | April 2025 | 通过视觉-语言学习训练的视觉编码器,在零样本图像/视频分类与检索、文档/图像/视频问答、检测与深度估计等空间任务上达到 SOTA,利用对比视觉-语言训练、语言对齐和空间对齐,从中间层产生强大的通用嵌入,超越现有模型。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Lenet | December 1998 | 引入了卷积。 |
| Alex Net | September 2012 | 将 ReLU 激活和 Dropout 引入 CNN,ILSVRC 2012 冠军。 |
| VGG | September 2014 | 每层使用大量小尺寸滤波器以学习复杂特征,ILSVRC 2014 达到 SOTA。 |
| Inception Net | September 2014 | 引入 Inception 模块,由多个并行卷积层组成,用于在多个尺度识别不同特征。 |
| Inception Net v2 / Inception Net v3 | December 2015 | Inception 模块的设计优化,提升了性能和精度。 |
| Res Net | December 2015 | 引入残差连接,即绕过网络中一层或多层的捷径,ILSVRC 2015 冠军。 |
| Inception Net v4 / Inception ResNet | February 2016 | 结合 Inception Net 和 ResNet 的混合方法。 |
| Dense Net | August 2016 | 每一层都接收所有前面层的输入,形成层间稠密连接网络,可学习更多样化的特征。 |
| Xception | October 2016 | 基于 InceptionV3,但使用深度可分离卷积代替 Inception 模块。 |
| Res Next | November 2016 | 基于 ResNet,引入分组卷积概念,将卷积层的滤波器分为多个组。 |
| Mobile Net V1 | April 2017 | 使用深度可分离卷积,减少参数量和计算量。 |
| Mobile Net V2 | January 2018 | 基于 MobileNetv1 架构,使用倒置残差和线性瓶颈。 |
| Mobile Net V3 | May 2019 | 使用 AutoML 为给定问题寻找最优神经网络架构。 |
| Efficient Net | May 2019 | 使用复合缩放方法缩放网络深度、宽度和分辨率,以较低的计算成本达到高精度。 |
| NF Net | February 2021 | 改进的无归一化 ResNet 系列,实现了批量归一化网络、更快的训练速度,并引入自适应梯度裁剪技术来克服深层 ResNet 的不稳定性。 |
| Conv Mixer | January 2022 | 使用标准卷积处理图像图块,混合空间和通道维度。 |
| ConvNeXt | January 2022 | 纯 ConvNet 模型,由标准 ResNet 设计演化而来,在精度和可扩展性上可与 Transformer 竞争。 |
| ConvNeXt V2 | January 2023 | 融入全卷积 MAE 框架和全局响应归一化(GRN)层,在多个基准上提升性能。 |
| Efficient Net V2 | April 2024 | 新的卷积网络家族,通过神经架构搜索和缩放,结合渐进式学习,在多种数据集上训练速度更快、参数效率更高,训练速度最高提升 11 倍。 |
| MobileNetV4 | April 2024 | 采用通用高效架构设计,包括通用倒置瓶颈(UIB)搜索块、Mobile MQA 注意力块和优化的神经架构搜索流程,在多种移动设备和加速器上实现高精度和高效率。 |
| LSNet | March 2025 | 模仿人类视觉系统"见大、聚焦小"策略,使用新颖的大-小(LS)卷积,结合大核静态卷积进行广泛上下文感知与小核动态卷积(含分组机制)在小视野内精确自适应特征聚合。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| SSD | December 2015 | 在每个特征图上对多种尺度和长宽比的边界框输出进行离散化。 |
| Feature Pyramid Network | December 2016 | 利用深度卷积网络固有的多尺度层次结构,高效构建特征金字塔。 |
| Focal Loss | August 2017 | 通过降低对已正确分类样本的损失权重,解决稠密目标检测中的类别不平衡问题。 |
| DETR | May 2020 | 新颖的目标检测模型,将目标检测视为集合预测问题,消除了手工设计组件的需求。 |
| OWL ViT | May 2022 | 采用视觉 Transformer、基于 CLIP 的对比预训练和二分图匹配损失进行开放词汇检测,利用图像级预训练、多头注意力池化和马赛克图像增强。 |
| Segment Anything Model | April 2023 | 引入新颖的图像分割任务、模型和数据集,旨在实现计算机视觉中可提示的零样本迁移学习。 |
| SAM 2 | July 2024 | 基于简单 Transformer 架构与流式记忆的基础模型,用于解决图像和视频中的可提示视觉分割,支持实时视频处理。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| RCNN | November 2013 | 用选择性搜索生成区域提议,CNN 提取特征,SVM 分类,随后进行边界框偏移回归。 |
| Fast RCNN | April 2015 | 整图输入 CNN,采用 RoI 池化从 ROI 提取特征向量,随后进行分类和边界框回归。 |
| Faster RCNN | June 2015 | 区域提议网络(RPN)与 Fast R-CNN 检测器共享卷积特征,协同预测目标区域。 |
| Mask RCNN | March 2017 | 在 Faster R-CNN 基础上扩展以解决实例分割任务,在现有分支之外并行增加预测目标掩码的分支。 |
| Cascade RCNN | December 2017 | 提出多阶段方法,用渐进提高的 IoU 阈值训练检测器,提升对假阳性的判别能力。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| U-Net | May 2015 | 为图像分割设计的架构,由捕获上下文的收缩路径和精确定位的扩展路径组成。 |
| U-ViT | September 2022 | 基于 ViT 的扩散模型图像生成架构,将所有输入(包括时间、条件和噪声图像图块)都视为词元。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Table Net | January 2020 | 端到端深度学习模型,用于表格检测和结构识别。 |
| SPADE | May 2020 | 将信息抽取(IE)形式化为空间依存解析问题。 |
| Layout Parser | March 2021 | 集成 Detectron2、CNN-RNN OCR、版式结构、TensorFlow/PyTorch 和模型库的库,工具包包含 Tesseract、Google Cloud Vision OCR、主动学习工具和社区平台,确保高效与可适应性。 |
| Layout Reader | August 2021 | 从文档图像准确预测阅读顺序、文本和版式信息的 seq2seq 模型。 |
| Donut | November 2021 | 无 OCR 的编码器-解码器 Transformer 模型,编码器输入图像,解码器输入提示与编码图像以生成所需文本。 |
| DiT | March 2022 | 在文档图像上(自监督)预训练的图像 Transformer。 |
| Pix2Struct | October 2022 | 为视觉语言理解预训练的图像到文本模型,特别针对涉及视觉情境语言的任务。 |
| Matcha | December 2022 | 基于 Pix2Struct,引入专注于数学推理和图表反渲染的预训练任务,提升图表理解能力,增强多样化视觉语言任务的理解。 |
| DePlot | December 2022 | 基于 MatCha,将图表转表格任务标准化,把图表翻译为线性化表格(markdown)供 LLM 处理。 |
| UDoP | December 2022 | 通过视觉-文本-版式 Transformer 融合文本、图像和版式信息,实现统一表示。 |
| GeoLayoutLM | April 2023 | 在预训练中显式建模几何关系,增强特征表示。 |
| Nougat | August 2023 | 执行光学字符识别(OCR)任务的视觉 Transformer 模型,将科学文档处理为标记语言。 |
| LMDX | September 2023 | 使任意 LLM 适配文档信息抽取的方法。 |
| DocLLM | January 2024 | 传统 LLM 的轻量扩展,专注于视觉文档推理,融合文本语义和空间版式,无需昂贵的图像编码器。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Layout LM | December 2019 | 以 BERT 为主干,新增两种输入嵌入:2-D 位置嵌入和图像嵌入(仅用于下游任务)。 |
| LamBERT | February 2020 | 以 RoBERTa 为主干,增加版式嵌入和相对偏置。 |
| Layout LM v2 | December 2020 | 使用多模态 Transformer 模型,在预训练阶段融合文本、版式和图像,端到端学习跨模态交互。 |
| Structural LM | May 2021 | 以 BERT 为主干,将文本、1D 和(2D 单元级)嵌入输入 Transformer 模型。 |
| Doc Former | June 2021 | 带 CNN 主干的仅编码器 Transformer,通过多模态自注意力层融合文本、视觉和空间特征。 |
| BROS | August 2021 | 基于 BERT,在 2D 空间编码文本相对位置,通过区域掩码策略从无标注文档学习。 |
| LiLT | February 2022 | 引入双向注意力互补机制(BiACM),实现文本与版式的跨模态交互。 |
| Layout LM V3 | April 2022 | 统一的文本-图像多模态 Transformer,学习跨模态表示,输入为文本嵌入与图像嵌入的拼接。 |
| ERNIE Layout | October 2022 | 利用版式信息重组词元,结合文本和视觉嵌入,采用空间感知解耦注意力的多模态 Transformer。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Generative Adversarial Networks | June 2014 | 提出一个框架,其中生成模型与判别模型在极小极大博弈中同时训练。 |
| Conditional Generative Adversarial Networks | November 2014 | 一种训练 GAN 的方法,通过将特定条件同时输入生成器和判别器网络,使生成过程可基于条件进行。 |
| Deep Convolutional Generative Adversarial Networks | November 2015 | 采用特定的架构约束设计,展示了 CNN 用于无监督学习的能力。 |
| Improved GAN | June 2016 | 提出了一系列可应用于生成对抗网络(GAN)框架的新型架构特性与训练流程。 |
| Wasserstein Generative Adversarial Networks | January 2017 | 一种替代性的 GAN 训练算法,提升了学习稳定性,缓解了模式崩溃等问题。 |
| Cycle GAN | March 2017 | 在没有配对样本的情况下,学习将图像从源域 X 转换到目标域 Y:借助对抗损失与循环一致性约束,使用两个 GAN 实现。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Entity Embeddings | April 2016 | 通过神经网络学习将类别变量映射到连续向量空间,揭示其内在属性。 |
| Wide and Deep Learning | June 2016 | 将对特定模式的记忆能力与对相似性的泛化能力相结合。 |
| Deep and Cross Network | August 2017 | 将一种新颖的交叉网络与深度神经网络(DNN)结合,无需人工特征工程即可高效学习特征交互。 |
| Tab Transformer | December 2020 | 使用基于多头注意力的 Transformer 层,将类别特征嵌入转换为稳健的上下文嵌入。 |
| Tabular ResNet | June 2021 | 一个带跳跃连接的 MLP。 |
| Feature Tokenizer Transformer | June 2021 | 将所有特征(类别与数值)转换为嵌入,并对嵌入堆叠 Transformer 层。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Obelics | June 2023 | 一个开放的网页级过滤数据集,由图文交错文档构成,包含 141M 网页、353M 关联图像和 115B 文本 token,提取自 CommonCrawl。 |
| Dolma | January 2024 | 一个开放的三万亿 token 语料库,旨在支持语言模型预训练研究。 |
| Aya Dataset | Februray 2024 | 一个人工精选的指令跟随数据集,覆盖 65 种语言,旨在弥合自然语言处理数据集中存在的语言鸿沟。 |
| WebSight | March 2024 | 一个合成数据集,包含 200 万对 HTML 代码及其对应截图,由 LLM 生成,旨在加速截图转 HTML 的研究。 |
| Cosmopedia | March 2024 | 包含 3000 万+文件、250 亿 token 的合成数据,由 Mixtral-8x7B-Instruct-v0. 生成,旨在复刻 Phi-1.5 的训练数据。 |
| RewardBench | March 2024 | 一个为评估 RLHF 中使用的奖励模型而设计的基准数据集与代码库。 |
| Fine Web | May 2024 | 一个用于 LLM 预训练的大规模数据集,包含 15T token,被证明比其他开放预训练数据集训练出的模型表现更好。 |
| Numina Math | July 2024 | 一个公开的 AI4Maths 数据集,包含 86 万道竞赛数学题及解答,覆盖从高中到高水平竞赛难度,并附有思维链标注。它旨在提升 LLM 的数学推理能力,并对开发赢得首届 AIMO 进步奖的模型起到关键作用,证明了其在推动最先进数学推理模型发展方面的有效性。 |
| Cosmopedia v2 | July 2024 | Cosmopedia 的增强版,重点优化了提示词。 |
| Docmatix | July 2024 | 一个面向 DocVQA 的大规模数据集,包含 240 万图像、950 万问答对和 130 万 PDF 文档:对 PDFA OCR 数据集的转录文本进行处理,并用 Phi-3-small 模型生成问答对。 |
| Pixmo | September 2024 | 一个高质量数据集,包含通过语音标注收集的详细图像描述,有助于构建更稳健、更准确的视觉语言模型(VLM)。 |
| Smol Talk | November 2024 | 一个合成的指令跟随数据集,包含 100 万样本:使用在多种指令跟随数据集上微调的 LLM,再用各类提示与指令生成合成对话,以提升指令跟随、对话与推理能力。 |
| Red Pajama V1 | November 2024 | 对 LLaMA 训练数据集的复刻,基于七个来源(CommonCrawl、C4、GitHub、Wikipedia、Books、ArXiv 和 Stack Exchange)构建,共计 1.2 万亿 token。复刻过程中处理了原始 LLaMA 文档中的缺口与模糊之处,数据处理选择上存在一些差异。 |
| Red Pajama V2 | November 2024 | 一个源自 CommonCrawl 的大规模未过滤网页数据集,包含 100 万亿+ token、覆盖多种语言。它包含多种质量信号(自然语言指标、重复度、内容标记、机器学习启发式与去重数据)作为元数据,支持灵活的过滤与数据集构建,可服务于多样化的下游任务。 |
| Numina Math 1.5 | February 2025 | NuminaMath 数据集的更新版,包含约 90 万道带思维链(CoT)解答的竞赛级数学题,来源从中国高中习题到国际数学奥林匹克。它包含每道题的答案、problem_type、question_type 等元数据,并收录了人工精选的奥赛、竞赛及特定数学领域数据,同时移除了合成数据集 synthetic_amc。 |
| OmniMath | October 2024 | 一个综合基准数据集,用于评估 LLM 在奥赛级别的数学推理能力:包含 4428 道竞赛级题目,覆盖 33 个子领域和 10 个难度等级;评估过程严格,采用 GPT-4o 与开源验证器 OmniJudge,旨在解决现有基准已被先进 LLM 轻易攻克的问题。 |
| DeepMath | April 2025 | 一个约 10.3 万道高难度数学题的大规模数据集,用于通过强化学习或监督微调训练推理模型。它为每道题提供可验证答案以支持基于规则的 RL,每题附带三种 AI 生成的解答以支持多样化的训练方式,并针对现有基准进行了严格的去污染处理,以保证评估的完整性并促进可泛化的推理能力。 |
| SweEval | May 2025 | 一个跨语言的企业安全基准,用于评估大语言模型(LLM)在不同语言与文化语境下处理敏感语言的能力。它评估 LLM 对不当指令(如包含脏话)是遵从还是拒绝,并考察其与伦理框架和文化细微差别的对齐程度。 |
| OpenThoughts | June 2025 | OpenThoughts 项目旨在为训练推理模型创建开源数据集,并据此开发了 OpenThinker 系列模型。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Self-Taught Reasoner (STaR) | May 2022 | 一种自举方法,通过为数据集生成推理过程、筛选出能得出正确答案的推理过程、在这些成功的推理过程上微调模型并重复该流程,迭代提升语言模型的推理能力;可选地通过"合理化"(rationalization)增强,即以正确答案为提示让模型生成推理过程。 |
| Reinforced Self-Training (ReST) | April 2023 | 通过从当前策略生成样本数据集(Grow 步骤)、基于源自人类偏好的奖励模型筛选样本(Improve 步骤),再用离线 RL 目标在筛选数据上微调模型,并不断提高筛选阈值重复该流程,迭代改进语言模型,持续优化输出质量。 |
| Reward rAnked FineTuning (RAFT) | April 2023 | 一种面向生成式基础模型的对齐框架:通过采样输出、基于奖励函数排序,再在排序最高的样本上微调模型,迭代优化模型。相比 PPO 等 RLHF 方法,该方法更稳定、更高效;通过解耦数据生成与微调降低了内存负担,并在 LLM 与扩散模型上都具有灵活性。 |
| ReST^EM | December 2023 | 一种基于期望最大化的语言模型强化学习自训练方法:迭代地从模型生成样本,用二值反馈筛选(E 步),再在这些筛选样本上微调基础预训练模型(M 步)。与原始 ReST 不同,ReST^EM 不使用人类数据增强,且每次迭代都在基础模型上微调,提升了迁移性能。 |
| Direct Preference Optimization | December 2023 | 一种稳定、高效、计算开销低的算法,通过简单的分类目标直接优化最满足偏好的策略,使 LLM 与人类偏好对齐,无需强化学习。 |
| V-STaR | February 2024 | 通过在模型生成的正确与错误解答上用直接偏好优化(DPO)训练一个验证器,同时仅在正确解答上微调生成器,最终在推理时用验证器从多个候选中选出最优解答,迭代提升语言模型的推理能力。 |
| Retrieval Augmented Fine Tuning (RAFT) | March 2024 | 一种训练方法,通过让 LLM 学会忽略无关文档、逐字引用相关段落并促进逻辑推理,提升其在开卷域内问答上的表现。 |
| RLHF Workflow | May 2024 | 提供了一份在线迭代 RLHF 的详细流程,并在多个基准上使用全开源数据集达到了最先进的性能。 |
| Magpie | June 2024 | 一种自合成方法:用左侧模板提示已对齐的 LLM,大规模提取高质量指令数据,生成了 400 万条指令及对应回复。 |
| Instruction Pre-Training | June 2024 | 一个框架,用指令-回复对扩充海量原始语料,实现语言模型的监督多任务预训练。 |
| Persona Hub | June 2024 | 一种基于角色(persona)的方法,用 LLM 创建多样化的合成数据:引入 Persona Hub——从网页数据自动精选的 10 亿角色集合。这些角色充当多样的知识载体,使 LLM 能够大规模生成多样的合成数据(如数学题、文本、游戏 NPC)。 |
| Self-Taught Evaluators | August 2024 | 一种迭代训练方案,仅使用合成生成的偏好数据、无需人工标注,提升 LLM 判断模型回复质量的能力:通过迭代生成对比性模型输出、训练 LLM-as-a-Judge 产出推理轨迹与判断,并在后续迭代中使用改进的预测。 |
| Direct Judgement Preference Optimization | September 2024 | 提出通过偏好优化来增强 LLM 裁判的评估能力,裁判在三种方法上训练:思维链评论(Chain-of-Thought Critique)、标准判断(Standard Judgement)和回复推演(Response Deduction),覆盖单评分、成对比较与分类等多种用例。 |
| Constrained Generative Policy Optimization (Mixture of Judges) | September 2024 | 一种 LLM 后训练范式,使用混合裁判(MoJ)与低成本约束策略优化(分层优化),解决 RLHF 中的奖励作弊与多目标优化难题。它通过基于规则和基于 LLM 的裁判识别并约束不良的生成模式,同时最大化校准奖励;针对多任务场景中每个任务采用定制的优化策略,避免目标冲突并改善帕累托前沿。 |
| LongCite | October 2024 | 一个系统,包含 LongBench-Cite 基准、用于生成带引用问答实例的 CoF 流程、LongCite-45k 数据集,以及在该数据集上训练的 LongCite-8B/9B 模型;通过让长上下文 LLM 生成带细粒度句子级引用的回复,提升其可信度。 |
| Thought Preference Optimization | October 2024 | 迭代训练 LLM 生成有助于提升回复质量的"思考":提示模型产出思考-回复对,用裁判模型对回复打分,从得分最高与最低的回复及其关联思考构造偏好对,再用 DPO 或 IRPO 损失优化思考生成过程;同时通过分数归一化缓解裁判模型的长度偏置。 |
| Self-Consistency Preference Optimization | November 2024 | 一种无监督的 LLM 迭代训练方法,利用自一致性构建偏好对:将最一致的回复作为选择回复、最不一致的作为拒绝回复,再优化加权损失函数,优先关注投票差距更大的样本对,反映模型对偏好的置信度。 |
| Hyperfitting | December 2024 | 在小数据集上微调预训练 LLM 直至训练损失接近零:尽管验证损失恶化,贪心解码的生成质量却显著提升。这种反直觉的过程锐化了模型的预测空间(常偏向单个 token),即使在引用屏蔽下也能改善长序列生成,表明改进并非简单的记忆。 |
| rStar-Math | January 2025 | 采用深度思考方法,结合蒙特卡洛树搜索与较小的语言模型,达到最先进的数学推理水平,可与 OpenAI 等大模型匹敌甚至超越。它采用新颖的代码增强 CoT 数据合成、基于成对排序训练的过程偏好模型(PPM),以及自我进化流程,迭代提升小语言模型在复杂数学问题(含奥赛级题目)上的表现。 |
| Multiagent Finetuning | January 2025 | 通过训练一个由专用模型组成的"社会"(生成智能体与评论智能体)在多智能体辩论生成的数据上训练,提升大语言模型。生成智能体在其自身正确的初始回复上微调,评论智能体在展示初始错误与最终修正答案的辩论序列上微调,从而促进多样性,并实现多轮迭代自我改进。 |
| Critique Finetuning | January 2025 | 训练语言模型对带噪声的问题回复进行批评,而非简单模仿正确答案,从而带来更深的理解与更强的推理能力。 |
| Diverse Preference Optimization | January 2025 | 通过基于奖励与多样性标准选择偏好对,提升语言模型的回复多样性。它不对比奖励最高与最低的回复,而是对比奖励阈值之上最多样化的回复与阈值之下最不具多样性的回复,促进输出更多样化的高质量回复。 |
| SFT Memorizes, RL Generalizes | January 2025 | 研究 SFT 与 RL 对基础模型泛化与记忆的相对影响(在 GeneralPoints 与 V-IRL 的文本与视觉任务上),发现 RL 在基于规则与视觉分布外场景下都显著提升泛化,而 SFT 主要记忆训练数据;SFT 能稳定输出格式以利于后续 RL 增益,扩展推理时计算(验证步数)可进一步提升 RL 泛化。 |
| SelfCite | February 2025 | 一种自监督方法,用于提升 LLM 生成引用的质量。它用上下文消融创建基于引用文本必要性与充分性的奖励信号,指导 best-of-N 采样或偏好优化(如 SimPO),训练 LLM 生成更好的引用,无需人工标注。 |
| Selective Self-to-Supervised Fine-Tuning (S3FT) | February 2025 | 在标准 SFT 基础上改进,利用同一输入存在多个有效回复的特性:当 LLM 自身的正确预测与标准答案一致时,在其预测上选择性微调,否则在标准答案(或其改写版本)上微调,缓解过拟合并提升泛化性能。 |
| SysGen | February 2025 | 一个为缺少系统消息的现有 SFT 数据集生成系统消息及对应对齐助手回复的流程:用八个关键功能标注系统消息中的短语,过滤错误标签,用 LLM-as-a-judge 验证功能恰当性,再基于精炼的系统消息与原始用户指令生成新的、更对齐的助手回复。 |
| Thinking Preference Optimization (ThinkPO) | February 2025 | 一种 SFT 后的方法,用 DPO 提升 LLM 的长 CoT 推理能力:利用现有 SFT 数据与现成的短思维链回复,将长推理回复视为偏好项,鼓励模型生成更长、更有条理的输出,无需新的昂贵长 CoT 数据。 |
| Code Guided Synthetic data generation system (CoSyn) | February 2025 | 一个利用 LLM 生成合成文本富集多模态数据以训练 VLM 的框架:用 LLM 创建多种语言(Python、HTML、LaTeX 等)的代码来渲染合成图像,再以代码为上下文生成对应的文本指令(包括问题、答案与解释),形成完整的指令微调数据集。 |
| Logic-RL | February 2025 | 一个基于规则的强化学习框架,在程序生成的骑士与无赖逻辑谜题上训练,提升大语言模型的推理能力。它采用改进的 REINFORCE++ 算法,配以严格的格式与基于答案的奖励系统,使模型发展出反思与验证等高级推理能力,并在小数据集训练后泛化到 AIME、AMC 等高难度数学基准。 |
| SPHERE | March 2025 | 一个自我进化的数据生成流程,通过三个阶段——初始推理路径的自我生成、路径错误的自我修正、用较小模型引入多样化错误推理——迭代生成、修正并多样化推理链,提升小语言模型的数学推理能力;再用该数据以直接偏好优化微调小语言模型。 |
| ReSearch | March 2025 | 一个通过强化学习训练 LLM 结合搜索进行推理的框架,将搜索操作视为推理链的有机组成部分,利用 GRPO 优化 LLM,使其生成包含文本思考、搜索查询与检索结果的推理链。 |
| CLIMB | April 2025 | 一个基于聚类的迭代数据混合自举框架:通过嵌入与聚类大规模数据集、利用代理模型与预测器迭代搜索最优混合,并通过自举策略精炼混合比例,自动发现语言模型预训练的最优数据混合。 |
| Test Time Reinforcement Learning | April 2025 | 一种在无标注数据上用强化学习训练 LLM 的方法:通过重复采样比较模型输出,以共识输出(如多数投票得出)作为最优动作的代理生成奖励信号,使模型在推理过程中无需真实标签即可自我进化。 |
| One-Shot RLVR | April 2025 | 仅用单个训练样本、以可验证奖励(如二值正误信号)进行强化学习训练 LLM,在数学推理任务上取得了与大得多的训练集相当的性能,令人意外。 |
| Absolute Zero | May 2025 | 一种无需任何人工精选数据即可训练推理模型的新型强化学习范式:单个模型学习提出能最大化自身学习进展的任务并通过解题提升推理能力,用代码执行器验证任务与答案,实现无需人工干预的持续自我改进。 |
| REFINE-AF | May 2025 | 一个半自动框架,用自动反馈强化学习为新任务生成高质量的指令-输入-输出三元组:用少量人工编写的种子任务生成指令,用强化学习提升输入-输出对质量,再构建指令微调数据集,通过监督微调精炼基础模型。 |
| J1 | May 2025 | 一种训练 LLM-as-a-Judge 模型的强化学习方法,将可验证与不可验证的提示都转换为带可验证奖励的判断任务,以激励思考并缓解判断偏置。 |
| ProRL | May 2025 | 挑战了"RL 只是放大已有输出"的观点,证明长期 RL 训练能发掘基础模型无法触及的新推理策略。ProRL 旨在支持更长的强化学习训练周期,通过 KL 散度控制、参考策略重置与多样化任务组合,促进对推理策略的更深探索。 |
| Perplexity-based Importance Refinement (PIR) | May 2025 | 一个优化思维链数据的框架:识别并剪除推理链中重要性低的功能步骤,同时保留核心的渐进推理。在 PIR 优化的数据上微调模型,可在高难度推理基准上提升准确率并减少 token 消耗。 |
| Adaptive Reasoning Model | May 2025 | 一个根据任务难度自适应选择推理格式(直接作答、短 CoT、代码、长 CoT)的推理模型,在性能与计算效率间取得平衡。它用 Ada-GRPO(GRPO 的改进版)训练,以解决格式坍缩问题并提升训练速度。 |
| rStar-Coder | May 2025 | 一种提升 LLM 代码推理能力的新方法:构建了 41.8 万道竞赛级代码题、58 万长推理解答与丰富测试用例的大规模验证数据集。它精选竞技编程题目、合成新的可解题目,用三步输入生成法与互验证机制生成可靠的输入-输出测试用例,并用测试用例验证过的长推理解答增强题目。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| Model Soup | March 2022 | 通过对多个不同超参数的微调模型取权重平均构造的模型汤,在不增加推理时间的前提下提升准确率与鲁棒性,通常优于超参数搜索中的最佳单模型,还能泛化到其他任务并改善分布外性能。 |
| ColD Fusion | December 2022 | 一种在不共享数据的情况下通过分布式计算实现多任务学习收益、并提升模型性能的方法。 |
| Spherical Linear Interpolation | 沿高维单位超球面上的最短大圆弧对两个模型的归一化权重向量做插值,从而保留二者参数空间之间的角度关系,实现所学行为的平滑组合。 | |
| Nearswap | 对与基础模型参数差异低于阈值 t 的权重,柔和地替换为次级模型的参数(否则保留基础权重),在保留基础模型结构的同时融合相似特征。 | |
| Task Arithmetic | December 2022 | 一种通过对任务向量(微调权重减去预训练权重得到)进行算术运算来编辑预训练神经网络的范式,支持多任务学习、针对性遗忘不良行为或整个任务,并利用任务间的类比关系提升数据稀缺任务的性能。 |
| Trim, Elect Sign & Merge (TIES) | June 2023 | 通过以下步骤解决参数间干扰:首先修剪冗余的低幅度参数变化,然后在剩余参数中选择跨模型总幅度最大的符号来解决符号冲突,最后仅对符号一致的参数取平均。 |
| Drop And REscale (DARE) | November 2023 | 通过随机将一定比例 (p) 的增量参数(微调权重与预训练权重之差)置零,并将剩余参数按 1/(1-p) 重缩放以近似原始嵌入,从而对多个模型的增量参数做稀疏化;随后对稀疏化后的模型应用现有模型合并技术(如平均或任务算术)。 |
| Model Breadcrumbs | December 2023 | 通过微调权重减去预训练权重,再经稀疏化过程去除离群值和可忽略的变化,构造稀疏权重集("breadcrumbs")。 |
| Model Stock | March 2024 | 利用如下观察:不同随机种子的微调权重在权重空间中分布于一个薄壳上,越接近该壳层中心性能越好。通过按几何推导的插值比例,将少量微调模型(通常仅两个)与预训练模型策略性地平均,Model Stock 近似得到接近中心的权重,达到相当或更优的性能。 |
| NuSLERP (Normalized SLERP) | 在两个(或可选三个,含基础)模型的参数之间做球面插值——通过 weight、nuslerp_flatten 和 nuslerp_row_wise 设置可配置张量展平与逐行 SLERP——无需专用基础模型即可对任务向量做角插值合并模型。 | |
| Drop and rEscaLe via sampLing with mAgnitude (DELLA) | June 2024 | 使用 MAGPRUNE(一种新的基于幅度的剪枝技术)舍弃不太重要的增量参数(微调权重与预训练权重之差)并重缩放剩余参数,随后选择符号一致的参数取平均,以减少模型合并中的干扰。 |
| Select, Calculate, and Erase (SCE) | August 2024 | 首先在多个目标 LLM 的融合向量(微调权重与基准模型权重之差)中,选出每个参数矩阵内变化最显著的前 τ% 元素;然后按所选元素平方和的比例为每个目标 LLM 计算参数矩阵级的合并系数;最后在融合向量间解决每个参数的符号冲突,擦除少数符号的元素,再用计算出的系数合并剩余参数并加到基准模型权重上。 |
| 论文 | 日期 | 简介 |
|---|---|---|
| TLDR | April 2020 | 针对科学论文的极限摘要,生成简洁的单句关键贡献总结。 |
| KL Divergence VS MSE for Knowledge Distillation | May 2021 | 从理论和实证上证明,在知识蒸馏中聚焦于 logit 匹配的 MSE 损失优于传统的 KL 散度损失;进一步表明序列蒸馏能提升性能,而使用小 tau 的 KL 散度损失可缓解标签噪声。 |
| What do Vision Transformers Learn | December 2022 | 深入分析视觉 Transformer 的工作机制及其与卷积神经网络的异同。 |
| Are Emergent Abilities of Large Language Models a Mirage? | April 2023 | 本文对涌现能力给出另一种解释:涌现能力源于研究者的度量选择,而非模型家族在特定任务上随规模发生的根本性行为变化。 |
| Scaling Data-Constrained Language Models | May 2023 | 本研究考察了数据受限场景下的语言模型规模扩展。 |
| Multiagent Debate | May 2023 | 多个语言模型实例独立针对问题生成答案,再经过多轮相互批评与更新,最终收敛为一个精炼答案。该过程模拟多线程推理与多源事实核查,利用模型的集体智能提升事实准确性与推理能力。 |
| RAGAS | September 2023 | 对 RAG 系统进行无参考评估的框架,评估检索系统找到相关上下文的能力、LLM 使用上下文的忠实度以及生成回答的整体质量。 |
| ConvNets Match Vision Transformers at Scale | October 2023 | 质疑"视觉 Transformer 在大数据集上优于 ConvNet"的观点,证明 ConvNet(特别是 NFNet)在大数据集上预训练并在 ImageNet 上微调后能达到相当的性能。 |
| DSPy | October 2023 | 一种编程模型,将 LM 管道抽象为文本转换图(即通过声明式模块调用 LM 的命令式计算图),通过签名、模块与 teleprompter 的结构化框架优化其使用,实现文本转换任务的自动化与增强。 |
| An In-depth Look at Gemini's Language Abilities | December 2023 | 以可复现代码和完全透明的结果,对 OpenAI GPT 与 Google Gemini 模型能力进行第三方客观对比。 |
| STORM | February 2024 | 一个写作系统,针对长文生成的预写作阶段:调研多元视角、模拟多视角提问、整理信息生成大纲,最终相比基线方法产出更有条理、更全面的文章。 |
| NuNER | February 2024 | 面向命名实体识别(NER)的基础模型,通过对 RoBERTa 继续预训练得到,采用在 GPT-3.5 标注的大数据集(源自 C4 子集)上的对比训练。 |
| PromptWizard | May 2024 | 一个利用 LLM 迭代合成与精炼特定任务提示的框架,通过同时优化提示指令与上下文示例来最大化模型性能。 |
| LearnLM Tutor | May 2024 | 基于 Gemini 1.0 的文本生成式 AI 家教模型,进一步针对一对一对话式辅导微调,在教育相关能力上优于提示调优的 Gemini 1.0。 |
| Monte Carlo Tree Self-refine | June 2024 | 将 LLM 与蒙特卡洛树搜索结合以提升复杂数学推理任务的性能,利用系统性探索与启发式自精炼机制改进决策框架。 |
| NuExtract | June 2024 | 在 C4 文本段落与 LLM 生成的结构化抽取模板及输出构成的合成数据集上微调的小语言模型;在复杂抽取任务上达到可比甚至优于 GPT-4 等大得多的 LLM 的性能,同时体积显著更小,支持零样本、混合少样本(使用输出示例)与微调能力。 |
| Proofread | June 2024 | 由服务端 LLM 驱动的 Gboard 功能,一键即可无缝完成句子级与段落级修正。 |
| CriticGPT | June 2024 | 基于 GPT-4 并经 RLHF 训练的模型,用于捕捉 ChatGPT 代码输出中的错误;输入问答对,输出指出答案潜在问题的结构化批评。 |
| Gemma APS | June 2024 | 提出一个可扩展且准确的命题切分模型:将命题切分建模为监督任务,在现有标注数据集上训练 LLM。 |
| ShieldGemma | July 2024 | 基于 Gemma2 的全套 LLM 安全内容审核模型(2B 至 27B 参数),对用户输入与 LLM 生成输出中的关键有害类型(色情、危险内容、骚扰、仇恨言论)提供安全风险预测。 |
| Spreadsheet LLM | July 2024 | 一种高效编码方法,利用 SheetCompressor 框架(基于结构锚点的压缩、逆索引转换、感知数据格式的聚合)有效压缩表格以供 LLM 使用,以及面向表格理解与表格问答的 Chain of Spreadsheet。 |
| OmniParser | August 2024 | 一种将用户界面截图解析为结构化元素的方法:通过准确识别可交互图标并理解元素语义,增强 GPT-4V 生成扎根于界面的动作的能力。 |
| Reader-LM | September 2024 | 专为从嘈杂的原始 HTML 直接生成干净 markdown 而训练的小型多语言模型,上下文长度可达 256K token。 |
| DataGemma | September 2024 | 一组旨在将 LLM 扎根于 Google Data Commons 的事实数据以减少幻觉的模型:用户可用自然语言提问,获得基于可信来源已验证信息的回答。 |
| GSM-Symbolic | October 2024 | 引入基于符号模板的新基准 GSM-Symbolic 来探究 LLM 真实的数学推理能力,揭示 LLM 表现不稳定、在复杂问题上吃力,且似乎依赖模式识别而非真正的逻辑推理。 |
| NuExtract 1.5 | October 2024 | NuExtract 的升级版,在源自 C4 文档与 LLM 生成的结构化抽取模板及输出的多语言合成数据集上训练,纳入更长的文档并采用 "continuation" 训练方法处理超出常规上下文窗口的文档,得到可在多语言、长文档上做结构化抽取的模型,性能可比甚至优于大得多的 LLM。 |
| LearnLM | December 2024 | 将监督微调(SFT)与基于人类反馈的强化学习(RLHF)结合以增强对话式 AI 的教学指导能力,与 Gemini 的 SFT、奖励模型(RM)及 RL 阶段协同训练。 |
| Open Scholar | December 2024 | 面向科学文献综合的检索增强大语言模型:使用 4500 万篇开放获取论文的大型数据存储、专用检索器,以及在合成生成数据上训练的开源 8B 模型和迭代自反馈生成,以准确引用回答科学问题。 |
| Shiksha | December 2024 | 通过挖掘 NPTEL 视频讲座的人工翻译字幕,构建包含八种印度语言、超过 280 万翻译对的多语言平行语料,以解决机器翻译模型有效处理科技语言(尤其低资源印度语言)的难题。 |
| Multi-LLM Text Summarization | December 2024 | 提出一种新颖的多 LLM 摘要框架,含集中式与去中心化两种方案:多个 LLM 生成多样化摘要,由单个 LLM(集中式)或全部 LLM(去中心化)迭代评估。 |
| Reader LM v2 | January 2025 | 一个 15 亿参数的语言模型,专门将原始 HTML 转换为 markdown 或 JSON,支持最长 512K token 与 29 种语言。以新范式与更高质量数据训练,将 HTML 转 markdown 视为翻译任务,并通过对比损失解决前代的退化问题。 |
| OmniParser V2 | February 2025 | 在 OmniParser 基础上改进:通过更大数据集训练与更小的图标描述模型,在小元素上精度更高、推理更快。 |
| Competitive Programming with Large Reasoning Models | February 2025 | 探究强化学习如何显著提升大语言模型在算法竞赛与软件工程任务上的性能,对比 OpenAI 的 o1、o1-ioi 与 o3 模型。 |
| olmOCR | February 2025 | 开源 Python 工具包,将 PDF 转换为线性化纯文本同时保留结构化内容(章节、表格、列表、公式等);采用文档锚定方法,利用微调的 7B VLM。 |
| Rethinking Compute-Optimal Test-Time Scaling | February 2025 | 研究大语言模型的计算最优测试时扩展(TTS),聚焦策略模型、过程奖励模型(PRM)与问题难度的影响,在 MATH-500 与 AIME24 上做实验。 |
| CHallenging AI with Synthetic Evaluations (CHASE) | February 2025 | 一个合成生成高难度 LLM 评测基准的框架:采用自底向上方法,从简单组件构建复杂问题并将解题要素隐藏于上下文中,同时将生成过程分解为可验证的子任务以确保正确性。 |
| Large-Scale Data Selection for Instruction Tuning | March 2025 | 考察指令微调 LLM 的自动化数据选择方法的有效性与可扩展性,发现许多现有方法在大规模下不如随机选择;一种基于表示的数据选择变体(RDS+,使用预训练 LM 隐藏状态的加权平均池化)在多任务场景下始终优于其他方法。 |
| Transformers without Normalization | March 2023 | 引入 Dynamic Tanh(DyT),一种替代 Transformer 中归一化层的简单逐元素操作:通过模拟层归一化的类 tanh 激活映射与缩放、无需统计计算,在视觉、语言与语音的多种任务上达到相当或更优的性能,挑战了归一化不可或缺的观念,并可能提升效率。 |
| SmolDocling | March 2025 | 一个 2.56 亿参数的紧凑型视觉语言模型,用于端到端文档转换,输出名为 DocTags 的新型通用标记格式,捕获所有页面元素的内容、结构与空间位置;采用课程学习方法,在增强的现有与新数据集上训练以实现全面文档理解,性能可比大得多的模型而计算需求最小。 |
| Long-To-Short LLM Reasoning With Model Merging | April 2025 | 探索模型合并作为 LLM 长转短推理的高效方法,目标是在不牺牲准确率的前提下减少冗长的推理步骤。研究发现:基于任务向量的合并将回答长度有效缩短约 50%,在 70 亿参数模型上准确率保持或略有提升;基于激活的合并更具潜力但对校准数据敏感;合并效果与模型规模相关——小模型难以学会复杂推理,大模型则难以大幅缩减长度。 |
| Does RL Incentivize Reasoning Capacity in LLMs Beyond the Base Model | April 2025 | 挑战"RLVR 显著提升 LLM 推理能力"的主流观点:研究发现 RLVR 虽在 pass@k 的低 k 值下提高了正确答案的采样效率,但在高 k 值下反而因减少了对基础模型中潜在成功推理路径的探索,限制了整体推理能力边界。 |
| QALIGN | April 2025 | 一种测试时对齐方法:使用马尔可夫链蒙特卡洛(MCMC)采样,在奖励模型引导下生成一系列对齐程度递增的文本样本,再用最小贝叶斯风险(MBR)从生成样本中选择最终输出。 |
| short-m@k | May 2025 | 挑战"LLM 推理链越长推理越好"的假设,证明较短的推理链往往更准确,并提出新的推理方法 short-m@k:并行生成多个推理链,在 m 条链完成后停止,用多数投票得到最终答案,以更低的计算成本与推理时间达到相当或更优的性能。 |
| Evaluation is All You Need | June 2025 | 本研究揭示,推理模型的基准评测结果受多种因素影响而大幅波动:评测条件的细微差异可导致结果显著变化,使其声称的性能提升难以可靠复现。 |
| 网络层 |
|---|
| Convolution Layer |
| Separable Convolution |
| Pointwise Convolution |
| Depthwise Convolution |
| Convolution Transpose |
| 网络层 |
|---|
| Simple Recurrent |
| LSTM |
| GRU |
| 网络层 |
|---|
| Scaled Dot Product Attention |
| Multi Head Attention |
| Cross Attention |
| Causal Attention |
| Sliding Window Attention |
| Multi Query Attention |
| Grouped Query Attention |
| 网络层 |
|---|
| Batch Normalisation |
| Layer Normalisation |
| Instance Normalisation |
| Group Normalisation |
| Weight Standardisation |
| Batch Channel Normalisation |
- Convolutional Neural Networks
- Layout Transformers
- Region-based Convolutional Neural Networks
- Tabular Deep Learning
- Generative Adversarial Networks
- Parameter Efficient Fine Tuning
- Convolution Layers
- Recurrent Layers
- Attention Layers
- Normalisation Layers
- Auto Encoders
- LLMs for Maths
- Model Merging
- Language Models
- Encoder Only Language Transformers
- Decoder Only Language Transformers
- Language Models for Retrieval
- Small LLMs
- LLMs for Code
- GPT Models
- LLaMA Models
- Gemini / Gemma Models
- Wizard Models
- Orca Series
- BLIP Series
- LLM Lingua Series
- Multi Task Language Models
- Layout Aware Transformers
- Retrieval and Representation Learning
- LLM Evaluation
- Vision Transformers
- Multi Modal Transformers
- Convolutional Neural Networks
- Object Detection
- Region Based Convolutional Neural Networks
- Document Information Processing
论文链接指向公开的论文解析原文,可作为延伸阅读。