跳转到内容

LLM核心概念

LLM 的进化是一个持续加速的过程,其历史阶段主要体现在 模型架构、训练方法和用户交互模式 的转变上。

1.1. 阶段一:统计语言模型时代(1990s - 2017)

Section titled “1.1. 阶段一:统计语言模型时代(1990s - 2017)”

核心:基于概率和浅层神经网络。

  • 模型特征: N-gram 模型、循环神经网络(RNN)、长短期记忆网络(LSTM)。模型参数量较小,通常是作为其他 NLP 任务的 辅助组件
  • 交互模式: 基础补全(Basic Completion)
    • 表现: 根据前面几个词预测下一个词,但对长距离上下文的理解非常有限。
  • API 格式
{
"model": "text-davinci-003",
"prompt": "User: 你好!\nAssistant: 我是AI助手,有什么可以帮你的?\nUser: 我想问一下LLM的核心概念有哪些?\nAssistant:", // 模型会补全这最后一句
"max_tokens": 150
}

1.2. 阶段二:Transformer 奠基与预训练爆发(2017 - 2021)

Section titled “1.2. 阶段二:Transformer 奠基与预训练爆发(2017 - 2021)”

核心:Transformer 架构的诞生与大规模预训练。

  • 模型特征:
    • 2017: Transformer 架构(注意力机制)出现。
    • 2018: BERT(双向编码器)和 GPT-1(单向解码器)出现,奠定了“预训练 + 微调”的范式。
    • 模型规模 开始突破 十亿级 参数。
  • 交互模式: 文本补全(Completion)与提示词工程(Prompting)的初步探索
    • 表现: 模型主要任务是 “续写”。用户输入一段起始文本(Prompt),模型则负责将其补全或生成一个完整的段落。这是最早期的 LLM 应用形式。
  • API 格式
{
"model": "gpt-4o",
"messages": [
{"role": "system", "content": "你是一个严谨的AI助手。"},
{"role": "user", "content": "你好!"},
{"role": "assistant", "content": "我是AI助手,有什么可以帮你的?"},
{"role": "user", "content": "我想问一下LLM的核心概念有哪些?"}
]
}

1.3. 阶段三:对齐与对话能力的涌现(2022 至今)

Section titled “1.3. 阶段三:对齐与对话能力的涌现(2022 至今)”

核心:通过对齐技术实现类人对话,并扩展多模态能力。

  • 模型特征:
    • 模型规模 达到 千亿级甚至万亿级,涌现出复杂推理能力。
    • 引入 RLHF(基于人类反馈的强化学习)对齐 技术。
    • 模型开始支持 多模态(如 GPT-4V),可以处理图像和文本。
  • 交互模式: 多轮对话(Chat)与智能代理(Agent)
    • 表现:
      • 从“Completion”到“Chat”: 模型的优化目标从简单的续写,转向 理解用户的指令、维护上下文、以 助手身份 进行多轮互动和解答。这是当前 LLM 最主要的交互形式。
      • 从“Chat”到“Agent”: 模型开始具备 规划能力工具调用 能力,能够根据指令自主执行复杂的、多步骤的任务。
  • API 格式

Assistant API 风格


这是用户影响 LLM 行为最直接、最核心的方式。

控制项作用与目的核心概念
主提示词 (Main Prompt)设定任务、提出问题或给出指令。直接决定模型要执行什么。Prompt
系统提示词 (System Prompt)设定模型的角色、个性和总体的行为规范,是最高级别的约束。例如:“你是一个专业的金融顾问,回答必须严谨。”Alignment
上下文/背景信息为模型提供必要的 背景知识、数据或前文内容,让模型基于这些信息来回答。Context Window
少量示例 (Few-shot Examples)在指令中包含 输入-预期输出的示例对,引导模型理解任务格式和风格。In-Context Learning (ICL)

2.2. 输出生成控制(Generation Parameters)

Section titled “2.2. 输出生成控制(Generation Parameters)”

这些参数在模型生成每一个 Token 时起作用,用于控制输出的 随机性、多样性和长度

控制项作用与目的核心概念
温度 (Temperature)控制输出的 随机性/创造性。值越高(通常接近 1),输出越随机、越具创造性;值越低(通常接近 0),输出越确定、越保守。Stochasticity
Top P控制输出的 多样性。模型只从累积概率达到阈值 的词汇中选择下一个词。值越高,选择范围越大,多样性越高。Sampling
最大输出长度 (Max Tokens)限制模型生成响应的最大 Token 数量。这有助于控制成本和响应时间,并防止模型陷入重复循环。Context Window
频率惩罚 (Frequency Penalty)减少对已生成词汇或短语的重复。值越高,模型越倾向于使用新的词汇,增加文本的词汇多样性。Repetition Control
存在惩罚 (Presence Penalty)减少重复生成同一实体或概念。与频率惩罚类似,但更侧重于内容而非词汇。Repetition Control
停止序列 (Stop Sequences)定义一个或多个 文本片段,当模型生成这些片段时,立即停止生成。常用于结构化输出或多轮对话。Control Flow

2.3. 应用层控制(Application-Level Control)

Section titled “2.3. 应用层控制(Application-Level Control)”

These are users’ indirect ways to control LLM behavior through UI configuration.

控制项作用与目的核心概念
工具/插件选择 (Tool/Plugin Selection)用户可以 决定启用或禁用 哪些外部工具(如代码解释器、网络搜索、特定 API),从而控制模型的执行能力边界。Tool Use
知识源选择 (Knowledge Source Selection)在 RAG 架构中,用户可以指定模型 检索和参考的外部文档库或知识库,确保回答的专业性和准确性。Retrieval-Augmented Generation (RAG)
输出格式(例如 JSON 模式)要求模型以 特定的结构化格式(如 JSON、Markdown 或 XML)输出结果,便于下游程序处理。Structured Output

核心能力类别具体能力与表现关键价值点
1. 语言理解 (Understanding)深入理解人类语言的意图、上下文、语义、情感和潜在的复杂性。能够进行准确的问答、情感分析和用户意图识别。
2. 语言生成 (Generation)根据输入和上下文,创造性地、连贯地生成高质量、多样化的文本。能够撰写文章、邮件、报告、故事、以及营销文案。
3. 推理与逻辑 (Reasoning & Logic)具备逻辑推理、归纳、演绎和问题解决能力,处理复杂的指令或多步任务。能够进行数学运算、逻辑分析和复杂场景的分析判断。
4. 规划与执行 (Planning & Execution)根据目标,分解任务,制定步骤,并串联多个工具或操作来完成复杂的工作。能够作为智能代理,高效地执行业务流程和任务规划。
5. 知识与记忆 (Knowledge & Memory)在训练过程中吸收并储存海量的世界知识,并在需要时进行调用。能够作为强大的知识库,提供事实信息和背景知识。
6. 跨模态处理 (Multimodality)处理和生成文本以外的其他模态数据(如图像、音频、代码),并在模态间转换。能够“看图说话”,或根据文本生成图像。
7. 学习与适应 (Learning & Adaptation)能够在极少量示例(Few-shot)甚至无需示例(Zero-shot)的情况下快速适应新任务。提高了模型的泛化能力和部署效率。
8. 自动化与工具调用 (Tool Use / Augmentation)识别用户需求,自动调用外部工具(如搜索引擎、API)来增强自身能力。提高信息的准确性、实时性和功能边界。
9. 跨语言/文化处理 (Cross-lingual Processing)在不同的自然语言和文化语境之间进行高质量的翻译和本地化。打破语言壁垒,实现全球化应用。
10. 结构化处理与转换 (Structuring and Transformation)能够将非结构化的文本转化为结构化数据(如 JSON、表格),或反之。方便数据处理、分析和系统集成。
11. 角色扮演与风格转换 (Role-Playing & Persona Adaptation)模型能够采用特定的角色、语气、风格或人设来生成文本。创造高度个性化和沉浸式的用户体验。
12. 对齐与伦理约束 (Alignment and Ethical Constraint)使模型的输出遵循人类的价值观、伦理标准和法律法规。确保模型输出安全、公平且无害。

限制类别具体限制与表现关键影响
1. 幻觉与事实错误 (Hallucination & Factual Errors)模型倾向于生成听起来合理但实际上是虚构、错误或无法证实的信息。严重损害模型在事实查询、科学、法律和医疗等领域的 可靠性可信度
2. 上下文与记忆限制 (Context & Memory Limit)模型能处理的输入和输出文本长度是有限的。一旦超出窗口,模型会“忘记”较早的对话内容。限制了模型处理长文档、进行长时间多轮对话或进行复杂长期规划的能力。
3. 知识时效性与截止 (Knowledge Cutoff)模型的基础知识来自于训练数据,无法获取训练截止日期之后发生的实时信息。导致模型对最新事件、发展和趋势的回答过时或不准确。
4. 提示词敏感性 (Prompt Sensitivity)模型的输出质量和行为对输入的提示词(Prompt)中的微小变化非常敏感,难以稳定控制。使得构建可靠、可预测的应用变得困难。
5. 工具使用不稳定 (Tool Use Instability)模型在识别调用时机、选择正确工具、处理工具返回的复杂结果时,可能会出现判断错误或流程中断。影响了依赖外部实时数据或复杂操作的应用可靠性。
6. 推理与逻辑稳定性 (Reasoning & Logical Stability)模型在复杂的、多步骤的逻辑推理、精确的数学计算或需要严谨逻辑的场景中表现不稳定。限制了模型在复杂编程、科学计算和深度决策分析中的应用。
7. 偏见与伦理问题 (Bias & Ethical Issues)模型从训练数据中继承和放大了人类社会中存在的偏见,并可能生成有毒、歧视性或不公平的输出。造成社会影响风险,挑战模型的 公平性安全性
8. 感知与现实世界脱节 (Lack of Embodiment/Perception)LLM 本质上是基于文本的,缺乏对物理世界、时间、空间和因果关系的直接感知(即缺乏“常识”)。导致模型有时会提出在物理世界中不可行或荒谬的建议。
9. 缺乏情感与主观体验 (Lack of Subjective Experience)模型可以模拟情感的表达,但不具备真正的人类情感、意识和主观体验。限制了模型在需要高度同理心、共情和真正情感理解的场景中的应用。
10. 可解释性差(黑箱问题) (Lack of Interpretability / Black Box)LLM 的决策过程和内部运作机制极其复杂且不透明,难以追溯得出结论的确切原因。妨碍了在法律、医疗、金融等 高风险、强监管 领域对模型的信任和审计。
11. 极高的运行和部署成本 (High Inference & Deployment Cost)模型在运行推理时也需要巨大的计算资源和能源消耗。限制了模型在大规模、低成本、边缘设备或对能耗敏感的环境中的普及和应用。
12. 数据安全与隐私风险 (Data Security & Privacy Risks)模型可能无意中泄露训练数据中的私密信息(提取攻击),或其部署环境存在数据泄露风险。限制了模型在处理 高度敏感信息 的应用。

推理类型描述LLM 实例(如何实现)
逻辑推理 (Logical Reasoning)根据给定的前提和规则,推导出必然的结论。思维链(CoT):通过要求模型展示其逐步的思考过程,模型能显著提高解决多步逻辑问题的准确性。
常识推理 (Common Sense Reasoning)运用模型在预训练中学习到的广泛的、隐含的、关于世界的知识和规则来解决问题。上下文理解:例如,模型知道“雨伞”和“下雨”之间的关系,从而在需要时推荐带雨伞。
数学/符号推理 (Quantitative Reasoning)处理数字和数学运算,尽管 LLM 本身不是计算器,但它能理解数学表达式、单位和复杂计算的步骤。工具调用 (Tool Use):Agent 常常通过推理出需要计算,然后调用外部的 Python 或计算器工具来弥补 LLM 自身计算准确性的不足。
因果推理 (Causal Reasoning)分析事件之间的原因和结果关系,推测“如果…会怎样”。情境模拟:模型能够基于历史数据和已知模式,推断出某个行为或事件可能导致的后果。