LLM核心概念
1. 一. 历史
Section titled “1. 一. 历史”LLM 的进化是一个持续加速的过程,其历史阶段主要体现在 模型架构、训练方法和用户交互模式 的转变上。
1.1. 阶段一:统计语言模型时代(1990s - 2017)
Section titled “1.1. 阶段一:统计语言模型时代(1990s - 2017)”核心:基于概率和浅层神经网络。
- 模型特征: N-gram 模型、循环神经网络(RNN)、长短期记忆网络(LSTM)。模型参数量较小,通常是作为其他 NLP 任务的 辅助组件。
- 交互模式: 基础补全(Basic Completion)。
- 表现: 根据前面几个词预测下一个词,但对长距离上下文的理解非常有限。
- API 格式
{ "model": "text-davinci-003", "prompt": "User: 你好!\nAssistant: 我是AI助手,有什么可以帮你的?\nUser: 我想问一下LLM的核心概念有哪些?\nAssistant:", // 模型会补全这最后一句 "max_tokens": 150}1.2. 阶段二:Transformer 奠基与预训练爆发(2017 - 2021)
Section titled “1.2. 阶段二:Transformer 奠基与预训练爆发(2017 - 2021)”核心:Transformer 架构的诞生与大规模预训练。
- 模型特征:
- 2017: Transformer 架构(注意力机制)出现。
- 2018: BERT(双向编码器)和 GPT-1(单向解码器)出现,奠定了“预训练 + 微调”的范式。
- 模型规模 开始突破 十亿级 参数。
- 交互模式: 文本补全(Completion)与提示词工程(Prompting)的初步探索。
- 表现: 模型主要任务是 “续写”。用户输入一段起始文本(Prompt),模型则负责将其补全或生成一个完整的段落。这是最早期的 LLM 应用形式。
- API 格式
{ "model": "gpt-4o", "messages": [ {"role": "system", "content": "你是一个严谨的AI助手。"}, {"role": "user", "content": "你好!"}, {"role": "assistant", "content": "我是AI助手,有什么可以帮你的?"}, {"role": "user", "content": "我想问一下LLM的核心概念有哪些?"} ]}1.3. 阶段三:对齐与对话能力的涌现(2022 至今)
Section titled “1.3. 阶段三:对齐与对话能力的涌现(2022 至今)”核心:通过对齐技术实现类人对话,并扩展多模态能力。
- 模型特征:
- 模型规模 达到 千亿级甚至万亿级,涌现出复杂推理能力。
- 引入 RLHF(基于人类反馈的强化学习) 等 对齐 技术。
- 模型开始支持 多模态(如 GPT-4V),可以处理图像和文本。
- 交互模式: 多轮对话(Chat)与智能代理(Agent)。
- 表现:
- 从“Completion”到“Chat”: 模型的优化目标从简单的续写,转向 理解用户的指令、维护上下文、以 助手身份 进行多轮互动和解答。这是当前 LLM 最主要的交互形式。
- 从“Chat”到“Agent”: 模型开始具备 规划能力 和 工具调用 能力,能够根据指令自主执行复杂的、多步骤的任务。
- 表现:
- API 格式
Assistant API 风格
2. 二. 核心组件
Section titled “2. 二. 核心组件”2.1. 输入控制(Prompt Engineering)
Section titled “2.1. 输入控制(Prompt Engineering)”这是用户影响 LLM 行为最直接、最核心的方式。
| 控制项 | 作用与目的 | 核心概念 |
|---|---|---|
| 主提示词 (Main Prompt) | 设定任务、提出问题或给出指令。直接决定模型要执行什么。 | Prompt |
| 系统提示词 (System Prompt) | 设定模型的角色、个性和总体的行为规范,是最高级别的约束。例如:“你是一个专业的金融顾问,回答必须严谨。” | Alignment |
| 上下文/背景信息 | 为模型提供必要的 背景知识、数据或前文内容,让模型基于这些信息来回答。 | Context Window |
| 少量示例 (Few-shot Examples) | 在指令中包含 输入-预期输出的示例对,引导模型理解任务格式和风格。 | In-Context Learning (ICL) |
2.2. 输出生成控制(Generation Parameters)
Section titled “2.2. 输出生成控制(Generation Parameters)”这些参数在模型生成每一个 Token 时起作用,用于控制输出的 随机性、多样性和长度。
| 控制项 | 作用与目的 | 核心概念 | |
|---|---|---|---|
| 温度 (Temperature) | 控制输出的 随机性/创造性。值越高(通常接近 1),输出越随机、越具创造性;值越低(通常接近 0),输出越确定、越保守。 | Stochasticity | |
| Top P | 控制输出的 多样性。模型只从累积概率达到阈值 | Sampling | |
| 最大输出长度 (Max Tokens) | 限制模型生成响应的最大 Token 数量。这有助于控制成本和响应时间,并防止模型陷入重复循环。 | Context Window | |
| 频率惩罚 (Frequency Penalty) | 减少对已生成词汇或短语的重复。值越高,模型越倾向于使用新的词汇,增加文本的词汇多样性。 | Repetition Control | |
| 存在惩罚 (Presence Penalty) | 减少重复生成同一实体或概念。与频率惩罚类似,但更侧重于内容而非词汇。 | Repetition Control | |
| 停止序列 (Stop Sequences) | 定义一个或多个 文本片段,当模型生成这些片段时,立即停止生成。常用于结构化输出或多轮对话。 | Control Flow |
2.3. 应用层控制(Application-Level Control)
Section titled “2.3. 应用层控制(Application-Level Control)”These are users’ indirect ways to control LLM behavior through UI configuration.
| 控制项 | 作用与目的 | 核心概念 |
|---|---|---|
| 工具/插件选择 (Tool/Plugin Selection) | 用户可以 决定启用或禁用 哪些外部工具(如代码解释器、网络搜索、特定 API),从而控制模型的执行能力边界。 | Tool Use |
| 知识源选择 (Knowledge Source Selection) | 在 RAG 架构中,用户可以指定模型 检索和参考的外部文档库或知识库,确保回答的专业性和准确性。 | Retrieval-Augmented Generation (RAG) |
| 输出格式(例如 JSON 模式) | 要求模型以 特定的结构化格式(如 JSON、Markdown 或 XML)输出结果,便于下游程序处理。 | Structured Output |
3. 三. 核心能力
Section titled “3. 三. 核心能力”| 核心能力类别 | 具体能力与表现 | 关键价值点 |
|---|---|---|
| 1. 语言理解 (Understanding) | 深入理解人类语言的意图、上下文、语义、情感和潜在的复杂性。 | 能够进行准确的问答、情感分析和用户意图识别。 |
| 2. 语言生成 (Generation) | 根据输入和上下文,创造性地、连贯地生成高质量、多样化的文本。 | 能够撰写文章、邮件、报告、故事、以及营销文案。 |
| 3. 推理与逻辑 (Reasoning & Logic) | 具备逻辑推理、归纳、演绎和问题解决能力,处理复杂的指令或多步任务。 | 能够进行数学运算、逻辑分析和复杂场景的分析判断。 |
| 4. 规划与执行 (Planning & Execution) | 根据目标,分解任务,制定步骤,并串联多个工具或操作来完成复杂的工作。 | 能够作为智能代理,高效地执行业务流程和任务规划。 |
| 5. 知识与记忆 (Knowledge & Memory) | 在训练过程中吸收并储存海量的世界知识,并在需要时进行调用。 | 能够作为强大的知识库,提供事实信息和背景知识。 |
| 6. 跨模态处理 (Multimodality) | 处理和生成文本以外的其他模态数据(如图像、音频、代码),并在模态间转换。 | 能够“看图说话”,或根据文本生成图像。 |
| 7. 学习与适应 (Learning & Adaptation) | 能够在极少量示例(Few-shot)甚至无需示例(Zero-shot)的情况下快速适应新任务。 | 提高了模型的泛化能力和部署效率。 |
| 8. 自动化与工具调用 (Tool Use / Augmentation) | 识别用户需求,自动调用外部工具(如搜索引擎、API)来增强自身能力。 | 提高信息的准确性、实时性和功能边界。 |
| 9. 跨语言/文化处理 (Cross-lingual Processing) | 在不同的自然语言和文化语境之间进行高质量的翻译和本地化。 | 打破语言壁垒,实现全球化应用。 |
| 10. 结构化处理与转换 (Structuring and Transformation) | 能够将非结构化的文本转化为结构化数据(如 JSON、表格),或反之。 | 方便数据处理、分析和系统集成。 |
| 11. 角色扮演与风格转换 (Role-Playing & Persona Adaptation) | 模型能够采用特定的角色、语气、风格或人设来生成文本。 | 创造高度个性化和沉浸式的用户体验。 |
| 12. 对齐与伦理约束 (Alignment and Ethical Constraint) | 使模型的输出遵循人类的价值观、伦理标准和法律法规。 | 确保模型输出安全、公平且无害。 |
4. 四. 能力限制
Section titled “4. 四. 能力限制”| 限制类别 | 具体限制与表现 | 关键影响 |
|---|---|---|
| 1. 幻觉与事实错误 (Hallucination & Factual Errors) | 模型倾向于生成听起来合理但实际上是虚构、错误或无法证实的信息。 | 严重损害模型在事实查询、科学、法律和医疗等领域的 可靠性 和 可信度。 |
| 2. 上下文与记忆限制 (Context & Memory Limit) | 模型能处理的输入和输出文本长度是有限的。一旦超出窗口,模型会“忘记”较早的对话内容。 | 限制了模型处理长文档、进行长时间多轮对话或进行复杂长期规划的能力。 |
| 3. 知识时效性与截止 (Knowledge Cutoff) | 模型的基础知识来自于训练数据,无法获取训练截止日期之后发生的实时信息。 | 导致模型对最新事件、发展和趋势的回答过时或不准确。 |
| 4. 提示词敏感性 (Prompt Sensitivity) | 模型的输出质量和行为对输入的提示词(Prompt)中的微小变化非常敏感,难以稳定控制。 | 使得构建可靠、可预测的应用变得困难。 |
| 5. 工具使用不稳定 (Tool Use Instability) | 模型在识别调用时机、选择正确工具、处理工具返回的复杂结果时,可能会出现判断错误或流程中断。 | 影响了依赖外部实时数据或复杂操作的应用可靠性。 |
| 6. 推理与逻辑稳定性 (Reasoning & Logical Stability) | 模型在复杂的、多步骤的逻辑推理、精确的数学计算或需要严谨逻辑的场景中表现不稳定。 | 限制了模型在复杂编程、科学计算和深度决策分析中的应用。 |
| 7. 偏见与伦理问题 (Bias & Ethical Issues) | 模型从训练数据中继承和放大了人类社会中存在的偏见,并可能生成有毒、歧视性或不公平的输出。 | 造成社会影响风险,挑战模型的 公平性 和 安全性。 |
| 8. 感知与现实世界脱节 (Lack of Embodiment/Perception) | LLM 本质上是基于文本的,缺乏对物理世界、时间、空间和因果关系的直接感知(即缺乏“常识”)。 | 导致模型有时会提出在物理世界中不可行或荒谬的建议。 |
| 9. 缺乏情感与主观体验 (Lack of Subjective Experience) | 模型可以模拟情感的表达,但不具备真正的人类情感、意识和主观体验。 | 限制了模型在需要高度同理心、共情和真正情感理解的场景中的应用。 |
| 10. 可解释性差(黑箱问题) (Lack of Interpretability / Black Box) | LLM 的决策过程和内部运作机制极其复杂且不透明,难以追溯得出结论的确切原因。 | 妨碍了在法律、医疗、金融等 高风险、强监管 领域对模型的信任和审计。 |
| 11. 极高的运行和部署成本 (High Inference & Deployment Cost) | 模型在运行推理时也需要巨大的计算资源和能源消耗。 | 限制了模型在大规模、低成本、边缘设备或对能耗敏感的环境中的普及和应用。 |
| 12. 数据安全与隐私风险 (Data Security & Privacy Risks) | 模型可能无意中泄露训练数据中的私密信息(提取攻击),或其部署环境存在数据泄露风险。 | 限制了模型在处理 高度敏感信息 的应用。 |
5. 五. 能力体现
Section titled “5. 五. 能力体现”5.1. 推理能力
Section titled “5.1. 推理能力”| 推理类型 | 描述 | LLM 实例(如何实现) |
|---|---|---|
| 逻辑推理 (Logical Reasoning) | 根据给定的前提和规则,推导出必然的结论。 | 思维链(CoT):通过要求模型展示其逐步的思考过程,模型能显著提高解决多步逻辑问题的准确性。 |
| 常识推理 (Common Sense Reasoning) | 运用模型在预训练中学习到的广泛的、隐含的、关于世界的知识和规则来解决问题。 | 上下文理解:例如,模型知道“雨伞”和“下雨”之间的关系,从而在需要时推荐带雨伞。 |
| 数学/符号推理 (Quantitative Reasoning) | 处理数字和数学运算,尽管 LLM 本身不是计算器,但它能理解数学表达式、单位和复杂计算的步骤。 | 工具调用 (Tool Use):Agent 常常通过推理出需要计算,然后调用外部的 Python 或计算器工具来弥补 LLM 自身计算准确性的不足。 |
| 因果推理 (Causal Reasoning) | 分析事件之间的原因和结果关系,推测“如果…会怎样”。 | 情境模拟:模型能够基于历史数据和已知模式,推断出某个行为或事件可能导致的后果。 |