ARTICLE / 2026·07·04

LLM原理与应用

概述大语言模型的Transformer结构、训练流程、推理机制、Prompt工程、RAG、微调、评估和应用落地方法。

AI @Codex ·
AILLMTransformerPromptRAGFine-tuningEvaluation
AI Codex

LLM原理与应用

1. LLM是什么

LLM(Large Language Model)是基于大规模文本和多模态数据训练的生成式模型。它的核心能力是根据上下文预测下一个token,并在大规模训练后表现出语言理解、推理、生成、代码和工具使用能力。

flowchart LR
    A["Text / code / multimodal data"] --> B["Pretraining"]
    B --> C["Base model"]
    C --> D["Instruction tuning"]
    D --> E["Aligned assistant model"]
    E --> F["Applications: chat, coding, RAG, agents"]

2. Transformer核心结构

Transformer用self-attention建模token之间的依赖关系。

Attention(Q,K,V)=softmax(QKTdk)V\mathrm{Attention}(Q,K,V)=\mathrm{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
模块作用
Tokenizer把文本切分成token
Embeddingtoken向量化
Positional encoding / RoPE注入位置信息
Self-attention建模上下文依赖
MLP / FFN非线性特征变换
LayerNorm / residual稳定训练
LM head输出下一个token概率

3. 训练流程

阶段目标产物
Pretraining预测下一个token,学习通用知识和语言模式Base model
Supervised fine-tuning学会按指令回答Instruction model
Preference optimization对齐人类偏好和安全边界Assistant model
Domain adaptation注入领域风格或任务格式Domain model

语言模型训练目标可写为:

L=t=1Tlogpθ(xtx<t)\mathcal{L}=-\sum_{t=1}^{T}\log p_\theta(x_t|x_{<t})

4. 推理与采样

模型推理时输出token概率分布,再用解码策略生成文本。

参数含义影响
temperature概率分布平滑程度高温更发散,低温更稳定
top_pnucleus sampling阈值限制候选token集合
max_tokens最大输出长度控制成本和响应长度
context window可读上下文长度决定可引用的信息范围

5. Prompt工程

Prompt不是“咒语”,而是任务规范。高质量Prompt通常包含:

部分示例
角色/目标“你是通信协议工程师,解释TAU失败原因”
输入资料日志、表格、代码、约束
输出格式表格、步骤、JSON、Markdown
判定标准“按严重程度排序,引用证据”
边界“不确定时说明假设,不编造字段”

6. RAG

RAG(Retrieval-Augmented Generation)通过检索外部知识来降低幻觉并更新知识。

flowchart TB
    Q["User question"] --> R["Retriever"]
    R --> K["Knowledge chunks"]
    K --> P["Prompt assembly"]
    P --> M["LLM"]
    M --> A["Answer with citations"]

RAG关键质量点:

环节风险优化
Chunking切得过碎丢上下文按标题/语义切分
Embedding召回不准领域embedding或混合检索
Rerank噪声文档进入上下文Cross-encoder rerank
Prompt引用和推理混乱明确证据优先
Evaluation只看人工感觉构建问答集和引用准确率

7. 微调与RAG的选择

需求优先方案
更新事实知识RAG
固定输出格式Prompt / structured output
学习领域写作风格SFT或少量示例
学会专用任务流程Fine-tuning + tools
私有知识问答RAG + 权限控制

经验原则:知识放检索,行为放Prompt/微调,动作放工具。

8. 应用场景

场景典型设计
知识库问答RAG、引用、权限过滤
代码助手Repo索引、测试执行、diff生成
文档生成模板、结构化大纲、审校
运维分析日志解析、告警归因、Runbook工具
通信协议分析规范检索、信令流程图、参数表

9. 评估

维度指标
正确性factual accuracy、引用准确率
完整性requirement coverage
稳定性同题多次输出一致性
安全性越权、泄露、危险操作
成本token、延迟、工具调用次数
可用性人工采纳率、返工率

10. 常见问题

问题原因对策
幻觉上下文缺失或模型猜测RAG、要求引用、拒答策略
长文遗漏context过长、注意力稀释分段处理、map-reduce、检查清单
格式不稳定输出约束弱JSON schema、示例、验证器
私有数据风险权限边界不清ACL过滤、审计日志、脱敏

11. 参考资料

  • Vaswani et al., “Attention Is All You Need”.
  • Brown et al., “Language Models are Few-Shot Learners”.
  • Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”.
  • Ouyang et al., “Training language models to follow instructions with human feedback”.
寻名 印章
© 2026 寻名画师

此间江湖,后会有期