AI 术语词典
从底层原理到前沿技术,快速读懂 AI 大模型领域的核心概念。
A
近邻检索(ANN)
ANN(近似最近邻检索)是向量数据库的核心检索范式:通过聚类、哈希、图索引等方式放弃一点点召回精度,换取比暴力精确检索快 100 到 1000 倍的查询速度。
应用程序接口
API(Application Programming Interface,应用程序接口)是一组定义软件组件之间交互方式的协议、工具和定义,用于让不同系统之间能够互相调用功能。
智能体
智能体(Agent)是具备自主感知、规划、决策和执行能力的 AI 系统,它以大语言模型为大脑,通过调用工具来完成复杂任务。
智能体记忆 Agent Memory
智能体记忆是 Agent 框架中用于跨轮次、跨任务存储和检索历史信息的组件,分为感官记忆、短期/工作记忆、长期记忆三层,决定了 Agent 能否记住用户偏好、避免重复犯错以及完成多步长周期任务。
注意力机制
注意力机制(Attention Mechanism)是一种让模型在处理序列数据时,动态地给不同位置分配不同权重的计算方法,是 Transformer 架构的核心组件。
自动扩缩容 Autoscaling
根据实时负载指标自动增减计算资源副本数或规格,平衡服务性能与成本,避免流量高峰与低谷时的资源浪费或不足
自适应检索增强生成 Adaptive RAG
根据用户问题的复杂度、领域、歧义度动态选择检索策略、召回深度和生成模型的 RAG 框架,避免所有问题一刀切使用相同链路。
AI 安全合规与数据隐私
AI 安全合规覆盖了模型输出内容安全、用户数据隐私、训练数据产权、跨境数据传输、可解释审计、算法备案、行业监管要求等一整套法律与工程治理体系。
AI 对齐
AI 对齐(AI Alignment)是确保 AI 系统的行为与人类意图、价值观和长远利益保持一致的研究领域,是大模型安全研究的核心议题。
API 版本管理与兼容性
API 版本管理是在 LLM 接口升级时,对路由、请求参数、模型名、响应结构做时间戳或版本号隔离,保证已有客户代码零改动即可继续运行的工程实践。
API 密钥
API Key(API 密钥)是一串用于鉴权的字符串,每次调用 API 时放在 Authorization: Bearer 请求头中,是计费、速率限制、权限隔离的核心凭证。
B
集束搜索解码
Beam Search 集束搜索是 LLM 文本生成的经典解码策略之一:每一步同时保留 Top-B 个最高概率的候选路径(Beam Size = B),继续扩展到下一步再全局剪枝,最后输出一条联合概率最高的完整序列;比贪婪解码质量更高,比纯随机采样更可控。
批大小
批大小(Batch Size)是指在模型训练或推理时,一次性送入模型的样本数量,是深度学习最重要的超参数之一。
批量接口
批量接口指离线异步处理大量请求的专用 API,相比同步接口通常享受 30%–75% 折扣,但延迟从秒级升到分钟/小时级,适合非实时批处理。
评估基准与评测框架
LLM 基准评测是衡量模型能力与对齐质量的标准化测试集与打分体系,涵盖通用推理、代码、数学、多语言、安全等数十个细分维度。
字节对编码
BPE(Byte Pair Encoding,字节对编码)是一种数据压缩算法,被广泛用于大语言模型的分词器(Tokenizer),用于将文本切分成高频子词单元。
API 基础地址
Base URL 是调用大模型 API 时请求路径的公共前缀部分,所有接口端点都挂在其下;典型值如 https://api.weimeta.cn/v1 或 https://api.openai.com/v1,漏写 /v1 是接入时最常见的 404 原因。
C
并发请求数
并发请求数指同一时刻正在等待响应、尚未完成的 API 请求总数(在飞请求),是 DeepSeek 等厂商采用的替代 RPM 的核心限流维度。
对比学习 Contrastive Learning
一种通过在嵌入空间中「拉近正样本对、推远负样本对」来训练表征模型的自监督/弱监督学习范式,是当代文本嵌入、图像表征、多模态对齐的核心基础算法。
缓存命中
缓存命中指 Prompt 前缀与近期请求完全一致时,服务商直接复用已计算好的 KV 缓存,大幅降低输入 Token 成本并减少延迟。
缓存未命中
缓存未命中指 Prompt 前缀与服务端缓存记录匹配失败,模型需要从头重新计算所有输入 Token 的 KV 张量,无法享受折扣价格和加速。
计算机使用工具调用
Computer Use 计算机使用是 2024 年下半年以来的 Agent 新能力:模型不再只输出文字回答,而是像真人一样操作图形界面(点击、输入、滚动、快捷键、打开文件、写代码运行等),典型实现是 Anthropic Claude 3.5 Computer Use、OpenAI Operator 系列。
检查点
Checkpoint(检查点)是模型训练过程中定期保存的模型权重快照,可用于断点续训、模型评估或版本回滚。
结构化抽取与模式约束解码
模式约束解码是强制 LLM 输出严格符合 JSON Schema / XML DTD / 正则 / 函数调用参数等预定义格式的技术,保证下游系统可直接解析而无需写正则兜底。
内容审核(安全过滤)
内容审核(安全过滤)是 API 服务端或客户端对输入 Prompt 和输出文本进行自动合规审查的机制,命中违规分类会拒绝请求或打安全标签,是大模型上线的必选项。
熔断器
熔断器(Circuit Breaker)是微服务稳定性设计模式:当某上游错误率/延迟持续超阈值时,自动在一段时间内直接失败,停止继续向坏上游投递请求,避免雪崩。
上下文窗口
上下文窗口(Context Window)是指大语言模型在一次交互中能够记住和处理的最大文本长度,通常以 Token 数量来衡量。
上下文蒸馏与长上下文压缩
上下文压缩是 RAG 与长文本场景中,在把检索结果或历史对话喂给 LLM 之前,用轻量模型或算法把冗余信息过滤、精简、摘要,显著降低输入 Token 成本并提升答案事实性的技术。
思维链
Chain-of-Thought 思维链是一种提示工程技巧:通过在 Prompt 中展示「问题→详细推理步骤→答案」的少样本示例,或直接写一句「请一步步思考」,显著提升大模型在数学、逻辑、多跳推理任务上的准确率。
宪法 AI Constitutional AI
通过一套明确的价值观原则(宪法)驱动模型自我修正,无需大规模人工标注即可完成安全与价值观对齐
余弦相似度
余弦相似度(Cosine Similarity)是通过计算两个向量夹角的余弦值来衡量它们相似程度的指标,取值范围 [-1, 1],是 Embedding 检索的核心度量。
灾难性遗忘 Catastrophic Forgetting
迁移学习/持续学习中,模型在学习新任务新知识后,几乎完全丧失先前习得任务能力的经典现象,是大模型微调、多任务学习、终身学习领域最核心的挑战之一。
D
解码阶段
Decode(解码)是大模型推理的第二阶段:基于 Prefill 产出的 KV Cache,逐 Token 自回归生成输出,每步只新增 1 个 Token,主要瓶颈是显存带宽而非算力。
扩散模型
扩散模型(Diffusion Model)是一类通过「逐步加噪-去噪」过程生成图像、音频或视频的生成式 AI 模型,是 Stable Diffusion、Sora 等明星产品的底层架构。
深度学习
深度学习(Deep Learning)是机器学习的一个分支,通过构建具有多层「人工神经网络」的模型,从海量数据中自动学习特征表示,是大语言模型的理论基础。
数据集治理 Dataset Curation
面向大模型预训练/微调/RAG 检索场景,对原始语料进行清洗、去重、过滤、去毒、分级、打分、版本管理的全流程工程体系,是决定模型下限和上限的最关键变量(比模型架构还重要)。
直接偏好优化
DPO 直接偏好优化是 2023 年斯坦福提出的 RLHF 轻量替代对齐方案:跳过 Reward Model 训练 + PPO 强化学习两步,直接把成对偏好数据融入一次简单的分类式监督损失,对齐效果接近 RLHF 但成本与复杂度砍 90%。
E
错误预算 Error Budget
基于服务等级目标 SLO 计算得出的、允许系统在一个周期内失败的最大配额,用于平衡「发布新功能」与「保障稳定性」之间的冲突
嵌入
嵌入(Embedding)是将文本、图像或声音映射为多维稠密向量(Vector)的技术,用于衡量内容之间的语义相似度。
涌现能力 Emergent Abilities
大语言模型在参数量、训练数据量、计算量三个维度同步缩放越过某个阈值后,突然获得的预训练时并未显式教授的、无法从小模型表现预测的全新复杂能力,是当代大模型最具革命性的核心现象。
指数退避
指数退避是 API 请求失败后逐步延长重试等待时间的策略,能有效避免在 429 限流或服务故障时形成重试风暴。
F
故障转移(回退)
Fallback(故障转移/回退)指当主模型、主厂商或主上游不可用时,API 网关自动切换到备用模型/备用厂商的高可用策略,是生产级多模型接入的必备能力。
函数绑定 Function Binding
函数绑定是 Function Calling 协议落地工程中把模型输出的工具调用(name + arguments JSON)映射到你后端实际可执行代码函数的过程,包含参数校验、鉴权、超时控制、熔断、重试等一整套执行管道。
函数调用
函数调用(Function Calling)是指大语言模型能够理解外部工具(API/函数)的功能,并在需要时智能地输出参数,让程序去执行真实动作的能力。
免费额度
免费额度(免费档)指厂商新注册账号可免费试用的赠金或配额,通常有严格的 RPM/TPM/RPD 限制与有效期,用于新手体验与技术选型验证。
模糊匹配 Fuzzy Match
模糊匹配是衡量两个字符串/短语在「字面不完全相同但语义或拼写近似」场景下是否能判定为同一条目的技术,广泛用于同义词匹配、错别字纠错、用户 Query 归一化、实体去重、RAG 中拼写容错检索。
模型微调
Fine-Tuning 微调是在一个已经预训练好的基础模型(Base Model)上,使用小规模领域特定数据继续训练若干步,让模型适配特定行业/任务/语气;相比只改 Prompt,微调能获得更稳定的能力提升。
频率惩罚
Frequency Penalty 频率惩罚是 OpenAI 兼容 API 的采样参数(-2.0 ~ +2.0),对每个已出现 Token 的惩罚量与其出现次数成正比,专门抑制说话结巴、同一段文字无限复制粘贴、代码中 print(1) 连打等现象。
少样本学习
少样本学习(Few-Shot Learning)是指模型仅通过少量示例(通常 1-10 个)就能学会新任务的能力,是大模型 In-Context Learning 的核心表现。
FlashAttention 加速算子
FlashAttention 是 Tri Dao 等人提出的 I/O 感知型 Attention 算子实现:通过分块计算(Tiling)+ SRAM 复用 + 反向重计算,在不改变输出数值的前提下把 Attention 速度提升 2–4 倍,显存占用减少数十倍,已被 vLLM 和 PyTorch 2.x 内置。
G
分组查询注意力
分组查询注意力 GQA 介于 MHA 与 MQA 之间:Query 头数保持不变,多组 Query 共享同一组 K/V 头,相比 MHA 大幅节省 KV Cache 显存,相比 MQA 几乎无损保留输出质量。
输出安全护栏
Guardrails 护栏是指在 LLM 输入侧(Prompt 到达模型前)和输出侧(模型回答给用户前)加的一层可编程过滤器:按预设规则/小模型/正则/JSON Schema 检测并拦截恶意输入、越权操作、格式错误、违规输出,是 LLM 生产安全的最后一道闸门。
梯度裁剪 Gradient Clipping
梯度裁剪是训练神经网络/大模型时防止梯度爆炸的关键稳定技巧:每一步计算完梯度后,当梯度的范数超过预设阈值时按比例缩小到阈值以内,保证训练不跑飞不出现 NaN Loss。
梯度检查点
Gradient Checkpointing 梯度检查点(激活重计算)是一种经典的显存-算力折衷技巧:在前向传播时不保存所有层的激活值,只保存关键检查点;反向传播到这一段时重新算一遍激活值,换取 30–50% 的显存下降,代价是训练时长增加约 20%。
梯度累积 Gradient Accumulation
梯度累积是在显存不足时,把原本一个大 Batch 的训练拆分成多个 Micro-Batch 分步算梯度并累积相加,等累积够等效大 Batch 之后才更新一次权重,用来在小显存 GPU 上模拟大 Batch 训练效果的技巧。
图检索增强生成 Graph RAG
基于知识图谱结构组织检索单元的 RAG 变体,通过实体-关系三元组建模文档间关联,支持多跳推理与全局事实一致性。
图形处理单元
GPU(Graphics Processing Unit,图形处理单元)是一种专门为并行计算设计的处理器,是训练和推理大语言模型的核心硬件。
H
大模型幻觉
Hallucination 幻觉指大模型在输出中「自信地编造了并不存在的事实」:虚构人物、编造引用文献、伪造 API 返回、假新闻、看似真实但完全不成立的代码接口名等,是 LLM 落地的核心风险之一。
幻觉检测 Hallucination Detection
在 LLM 生成答案后,通过事实核查、召回文档对齐、多模型交叉验证等技术手段自动识别输出中不存在于上下文或不符合真实世界事实的虚构内容。
混合检索 Hybrid Search
混合检索是在 RAG 中同时使用向量语义检索(Dense / Dense Embedding)和关键词检索(Sparse / BM25 / TF-IDF / 倒排索引),再用 Reciprocal Rank Fusion 或 Reranker 合并两路结果的技术,能在字面匹配和语义匹配两类 Query 上同时保持高召回率。
假设文档嵌入增强
HyDE 假设文档嵌入是 RAG 检索增强的前置技巧:先让 LLM 根据用户问题幻想一段理想答案文档,再把该幻想文档做 Embedding 并检索,解决了问题 embedding 与答案 embedding 语义空间不对称导致的召回差问题。
HTTP 429 错误
HTTP 429 是接口限流响应码,表示单位时间内请求量或 Token 量超过了服务商的速率限制,需要配合重试机制处理。
I
推理
推理(Inference)是指使用训练好的模型对输入数据产生预测或输出的过程,是大模型「学以致用」的关键阶段。
指令微调
指令微调(Instruction Tuning)是指在「指令-回答」配对数据上对预训练模型做监督微调,使其能够更好地理解和遵循人类指令。
指令蒸馏 Instruction Distillation
将大模型复杂推理能力通过知识蒸馏压缩到小模型,使其在保持指令遵循效果的同时显著降低推理成本
指令遵循 Instruction Following
指令遵循能力是衡量大模型能否准确理解并执行用户自然语言命令(约束、格式、主题、角色、多步组合)的核心指标,是从预训练底座进化为对话助手的第一道门槛。
J
K
键值缓存
KV Cache 是大模型推理阶段为历史 Token 的 Key 和 Value 张量建立的缓存机制,让每个新 Token 无需重新计算整个历史序列,是推理加速、长上下文运行的底层基础。
知识图谱
知识图谱 KG 是用实体-关系-实体三元组(SPO:Subject-Predicate-Object)组织知识的图结构;在 RAG 中补全多跳推理、消歧实体别名、发现隐含关系,是向量检索加关键词之外的第三大检索支柱。
知识蒸馏模型压缩
Knowledge Distillation 知识蒸馏是经典模型压缩技术:先训练一个大而准的教师模型,再让一个小得多的学生模型去拟合教师输出的 Softmax 软概率而非硬标签,在参数量降至 1/10 时保留教师 90% 以上的能力,是高吞吐场景的标配。
KTO 偏好对齐
KTO 是 2024 年提出的无需成对偏好的对齐算法:只需「被人类喜欢的样本」和「被人类讨厌的样本」两个集合,就能做偏好对齐,比 DPO 节省一半标注成本。
KV 缓存淘汰 KV Cache Eviction
KV 缓存淘汰是在 GPU 显存不足、推理请求并发多的时候,以什么策略丢弃哪些 KV Cache 页来腾空间给新请求的调度策略,常见有 LRU、优先级分级、滑动窗口、分层分区,直接决定了单 GPU 的并发上限和 OOM 故障率。
L
大语言模型
大语言模型(LLM)是基于深度学习(特别是 Transformer 架构)训练的、拥有数十亿甚至上万亿参数的自然语言处理模型。
低秩自适应
LoRA(Low-Rank Adaptation,低秩自适应)是一种参数高效微调技术,通过冻结原模型权重、仅训练低秩分解矩阵,实现以极低显存/成本完成大模型微调。
端到端延迟
Latency(端到端延迟)指从用户发出请求到接收到完整回答的总耗时,由网络、排队、Prefill、Decode 四部分相加组成,是评估 API 真实体验的黄金指标。
对数概率
Logprobs 是大模型对每个候选 Token 分配的概率的对数值(通常以 e 或 2 为底);API 暴露 logprobs 字段允许你拿到模型对「最可能的 Top-K 个 Token」各自打分,用于备选答案、置信度估计、困惑度计算、红队检测。
负载均衡
负载均衡指将请求按策略分发到多个上游(多厂商、多密钥、多区域、多模型)以聚合容量、降低延迟、避免单点过载,是高并发 AI 应用的基础架构能力。
延迟百分位 Latency Percentile
按概率分布统计的 API 响应延迟指标,用于衡量用户真实体验与系统尾部性能,而非只看平均值
长上下文窗口扩展(Long Context)
长上下文扩展是把 LLM 原生支持的最大输入长度从 4K/8K Token,扩展到 128K、1M 甚至更长的系列技术组合,涵盖 RoPE 外推、YaRN、位置编码修改、KV Cache 优化。
LLM 可观测性 LLM Observability
借鉴后端 APM(应用性能监控)方法论,针对 LLM 应用的输入/输出、Token 消耗、延迟、成本、链路 Trace、幻觉、Guardrails 拦截率等 20+ 维度做全链路采集、可视化、告警与归因分析的工程体系,是生产级 LLM 应用 7x24 稳定运行的核心基础设施。
M
多模态大模型
Multimodal 多模态指一类能同时理解和生成多种模态数据的大模型:不仅处理文本(Text),还能理解图片、音频、视频、3D、PDF 版式等;典型接口如 vision chat、speech-to-text、text-to-image、video understanding。
多模态大模型
多模态大模型(VLM / MLLM)是除了纯文本之外,能同时理解和生成图片、音频、视频、PDF 表格、结构化文档等多种模态输入输出的统一大模型架构。
多区域部署与容灾
多区域部署指在多个云地域(Region)独立运行多套推理集群,任一区域故障时通过流量切换 / 多活实现业务不中断;容灾 RPO/RTO 指标直接决定故障恢复能力。
多智能体协作(Multi-Agent Orchestration)
多智能体协作通过把一个复杂任务拆成多个独立角色的 Agent(检索/代码/数学/审核)分别处理,再由调度器按图结构编排传递结果,比单 LLM 一次生成质量提升显著。
混合精度训练 Mixed Precision Training (AMP)
混合精度训练是在训练神经网络时,把不同的计算(矩阵乘/Attention)用 FP16/BF16,其他容易溢出的计算(Loss 缩放、Softmax、梯度累加)保留 FP32,以此来把训练显存砍半、Tensor Core 计算速度翻倍且不损失精度的通用技巧。
混合专家架构
混合专家 MoE 是一种大模型稀疏激活架构:将一个巨大的前馈网络拆成 N 个并行专家子网络,每次推理只由 Router 选出 Top-K 个专家参与计算,同等参数量下速度翻倍。
每分钟 Token 数
TPM 是每分钟 Token 数的缩写,指 API 在 60 秒窗口内允许处理的 Token 总量,通常包含输入和输出 Token,是长上下文场景最关键的速率限制。
每分钟请求数
RPM 是每分钟请求数的缩写,指 API 接口在 60 秒滑动窗口内允许的最大调用次数,是大模型服务商最常用的速率限制指标。
每分钟输出 Token 数
OTPM 是每分钟输出 Token 数的缩写,指模型在 60 秒窗口内允许生成的输出 Token 总量,是长文本生成、代码补全场景的关键速率指标。
每分钟输入 Token 数
ITPM 是每分钟输入 Token 数的缩写,指 API 在 60 秒窗口内允许接收的输入 Token 总量(含 Prompt、System Message、文档上下文),是 RAG 与长对话场景的关键瓶颈。
模型卡片
Model Card 模型卡片是一份标准化文档(一般由模型发布方维护),公开披露一个大模型的基本信息:大小、架构、训练数据范围、评估分数、已知偏见/风险、推荐用法与禁用场景;便于消费方选型与合规。
模型融合 Model Merging
无需重新训练,通过权重线性或非线性组合融合多个独立微调模型的能力,低成本获得多任务强模型
深度混合 Mixture of Depths
由 Google DeepMind 2024 年提出的动态路由稀疏化 Transformer 架构:每个 token 在每层前向传播时由路由器决定「只走这一层做计算」还是「跳过这一层直接复用前面的输出」,用平均更少的 FLOPs 实现更深模型的等效能力。
最大输出 Token 数
最大输出 Token 数(max_tokens / max_completion_tokens)指单次 API 请求允许模型生成的输出 Token 上限,防止输出过长或控制成本。
N
O
分布外检测 Out-of-Distribution Detection
OOD 检测是判断模型当前输入是否来自于它训练时见过的数据分布的技术,是 LLM 安全、幻觉抑制、RAG 质量控制的第一道防线:输入越 OOD,模型输出越不可靠,应该走兜底或拒绝回答。
过拟合
过拟合(Overfitting)是指模型在训练集上表现极好,但在测试集或新数据上表现较差的现象,是机器学习中最常见的泛化问题之一。
OpenAI 兼容接口
OpenAI 兼容接口指 URL 结构、鉴权方式、请求响应字段、模型名映射均对齐 OpenAI 官方 REST 规范的第三方 API;接入方只需改 base_url + api_key 即可零代码切换供应商。
P
存在惩罚
Presence Penalty 存在惩罚是 OpenAI 兼容 API 的一个采样参数(-2.0 ~ +2.0),正数值会给**本轮对话中已经出现过一次以上的 Token** 额外加负对数偏置,鼓励模型聊新话题、不要原地打转。
规划执行 Plan-and-Execute
智能体架构中明确区分「规划阶段」和「执行阶段」的两阶段范式:先由规划器产出多步结构化计划,再由执行器按计划逐项调用工具,避免边想边做的漂移。
近端策略优化
PPO(近端策略优化)是 ChatGPT 时代强化学习对齐环节的标准算法:通过对策略更新幅度做 clip 裁剪约束,在保持训练稳定的前提下最大化奖励信号。
困惑度
PPL 困惑度是衡量语言模型「对一段文本预测得有多准」的经典指标:数值越低越好,PPL=10 表示模型下一步平均在 10 个等概率候选中做选择;PPL 与平均负对数似然成指数关系。
每百万 Token 计价
每百万 Token($/M、元/M)是大模型 API 的标准报价单位,按实际消耗的 Token 数乘以每百万单价计费。
前缀缓存 Prefix Caching
前缀缓存是把多个不同请求之间相同的 System Prompt / Tool Schema / 长文档上下文这类公共前缀的 KV Cache 预先算好持久化缓存,后续请求直接复用而不再重复计算,能让长 System Prompt 场景下的 TTFT 和总 Token 成本下降 30% 至 80%。
提示版本管理 Prompt Versioning
借鉴软件工程代码版本管理思想,对 LLM 应用中的 Prompt 模板、Few-shot 示例、模型参数、RAG 配置等进行版本化存储、A/B 实验、灰度发布、自动回滚的工程化体系,是 LLM 应用从 Demo 到生产必须补上的基础设施。
提示词
提示词(Prompt)是用户输入给大语言模型的文本指令,可以是问题、任务描述、上下文或示例,是 LLM 时代最核心的「编程语言」。
提示词工程
提示词工程(Prompt Engineering)是指通过设计、优化和迭代输入给大语言模型的文本(Prompt),来引导模型输出更高质量、更符合预期的结果的一门技术。
提示词缓存
提示词缓存是服务商在服务端保存 Prompt 前缀的 KV 张量缓存机制,匹配时直接复用已计算结果,降低成本并显著缩短首Token延迟。
提示词越狱与红队测试
提示词越狱是恶意用户通过构造特殊输入绕过模型安全对齐、诱导其输出违禁内容的攻击;红队测试则是主动模拟这类攻击来发现并修补安全漏洞的防御性工作。
提示词注入攻击
提示词注入 Prompt Injection 是一类针对 LLM 的攻击手法:攻击者在用户输入中嵌入恶意指令,诱使模型绕过 System Prompt 执行越权操作(泄露提示词、调用危险函数、输出违规内容)。
提示链 Prompt Chaining
将复杂任务拆解为多个依序执行的 LLM 子调用,前一个子任务的结构化输出作为后一个子任务的输入,通过分而治之降低单次生成的错误率。
预填充阶段
Prefill(预填充)是大模型推理的第一阶段:并行处理全部输入 Prompt,计算出所有输入 Token 的 KV 缓存和第一个输出 Token 的概率分布,决定了首 Token 延迟(TTFT)。
Q
查询改写 Query Transformation
在向量检索阶段,先让 LLM 对用户原始查询进行扩展、拆分、抽象、同义改写等预处理,再用改写后的查询去检索,显著提升 RAG 召回覆盖率。
量化
量化(Quantization)是将模型权重和激活值从高精度浮点(如 FP16)转换为低精度整数(如 INT8/INT4)的技术,可显著降低显存占用和推理延迟。
量化(GPTQ / AWQ / FP8 / INT4)
量化(Quantization)把模型权重和激活从 FP16/BF16 高精度降到 8 位、4 位甚至 3 位整数,最多把内存占用砍到原来 1/4,在精度下降 1% 以内的前提下让消费级卡也能跑大模型。
量化低秩微调
QLoRA 是 2023 年提出的 LoRA 扩展方案:将基础模型以 4-bit 或 3-bit NF4 量化加载冻结,只训练 LoRA 的低秩 A/B 矩阵,单张消费级 24G 显卡即可完成 70B 模型的微调,效果接近全参微调。
R
基于人类反馈的强化学习
RLHF(Reinforcement Learning from Human Feedback)是利用人类对模型输出的偏好排序训练奖励模型,再通过强化学习优化大模型的技术,是 ChatGPT 引爆的关键。
检索增强生成
检索增强生成(RAG)是一种结合了信息检索和文本生成的技术,旨在让大语言模型基于外部知识库给出准确回答,从而减少幻觉。
奖励模型
奖励模型 RM 是 RLHF 三阶段中的中间桥梁:基于人类偏好排序数据训练,输入一段模型输出即可输出一个 0 至 10 分的偏好分数,为 PPO 强化学习阶段提供可微分的奖励信号。
路由大模型 Router LLM
在多模型或多专家架构中,根据请求特征自动将流量路由到最合适的模型或专家,实现成本与效果的最优平衡
每秒请求数
RPS 每秒请求数衡量 API 系统实际吞吐能力:1 秒内成功处理的请求(非 Token)数量;和 RPM 的关系是 RPS = RPM ÷ 60。RPS 是 API 网关容量规划、SLA 承诺、压测的核心指标。
每日请求数
RPD 是每日请求数的缩写,指 API 在 24 小时滚动或日切窗口内允许的总调用次数,是免费档、低档位账号最常见的硬性日配额天花板。
速率限制
速率限制是 API 服务商为防止滥用、保障公平性对单位时间内调用量或 Token 量设置的硬性上限,超限通常返回 HTTP 429。
旋转位置编码
RoPE 旋转位置编码是 LLaMA/GPT-NeoX 等现代模型主流使用的相对位置编码方案:通过对 Query 和 Key 的向量空间进行复数域旋转,把位置信息注入注意力计算中,天然具备长度外推能力。
重排精排
Rerank 重排也叫精排,是 RAG 检索增强生成链路最后一段:把粗召回阶段(向量检索/关键词检索)返回的 Top-20 至 50 个候选片段,用交叉注意力模型重新打分排序,选出 Top-3 至 5 最相关的喂给大模型。
AI反馈强化学习
RLAIF AI 反馈强化学习是 RLHF 的低成本替代方案:不用人类标注员一条条打偏好对,而是用强的裁判模型 L Judge 自动生成偏好数据,再用 DPO/PPO 做对齐,效果接近 RLHF 但成本下降 90%,是当前开源对齐的主流方案。
ReAct 推理行动范式
ReAct(Reasoning + Act 推理与行动)是 2022 年 Google 提出的 Agent 经典工作流:交替进行思考推理(Thought)、调用工具或行动(Action)、观察结果(Observation)三段循环,直至得出最终答案,是现代 LLM Agent 框架的基础模式。
S
服务等级协议
SLA 服务等级协议是 AI API 供应商与客户之间的正式承诺:一般以月度可用性百分比(如 99.9%)、首字延迟 P95、错误率为核心指标,未达标时按比例退款或抵扣下月账单。
服务等级协议 SLA & 可用性
服务等级协议 SLA 是 API 服务商与客户之间承诺的可用性/延迟/错误率等量化指标及违约赔偿机制,99.9%/99.95%/99.99% 对应不同停机时长。
合成数据 Synthetic Data
由 LLM、GAN、规则引擎或物理仿真器自动生成的人工训练数据,用于在真实标注数据不足、昂贵或存在隐私风险时扩展训练集并提升模型鲁棒性。
滑窗注意力 Sliding Window Attention
稀疏注意力中最常用、工程性价比最高的一种特例:规定每个 token 只能关注其自身以及向前追溯的最近 W 个相邻 token(W 为窗口大小,通常 4096 或 8192),实现 O(N·W)≈O(N) 的线性复杂度。
监督微调
SFT(监督微调)是在通用基模型上用高质量任务数据集(问答、指令遵循、对话等)做有监督微调的训练环节,是 RLHF、DPO 等对齐流程的前置基础步骤。
结构化输出
结构化输出指一类 API 能力:通过 response_format、JSON Schema 等参数约束模型 100% 返回合法 JSON/指定格式,避免空白字符、语法错误、字段缺失。
流式输出
流式输出是 API 按 Server-Sent Events(SSE)协议逐 Token 返回结果的响应方式,让用户能边生成边阅读,显著改善交互体感。
每秒 Token 数
TPS 是每秒 Token 数的缩写,指模型生成输出的实时速度,直接决定聊天界面流式输出的流畅度与用户体验。
随机种子
Seed(随机种子)是 API 整数参数,指定后模型采样过程将尽量保持确定性,相同的 seed + 相同参数 + 相同输入理论上返回相同输出,用于测试、A/B、可复现流程。
缩放定律 Scaling Laws
预训练大模型时,模型最终损失 / 下游任务表现与「参数量 N、训练数据量 D、训练计算量 C」三个核心变量在双对数坐标下呈可预测的幂律线性关系,是大模型时代投资规划、训练预算分配的核心指导理论。
停止序列
Stop Sequence(停止序列)是字符串数组,作为生成终止信号;模型一旦命中其中任何一个字符串就立刻停输,常用于 JSON 收尾、对话段结束,避免无限续写。
投机解码
投机解码 Speculative Decoding 是一种推理加速方法:先用一个小而快的草稿模型猜测未来 K 个 Token,再用大模型一次性并行验证,猜对了就整段跳过,实测 TPS 提升 2–4 倍不损失输出分布。
稀疏注意力 Sparse Attention
通过只计算 query 与 key 的一部分子集的注意力权重(而非全部 N×N 对),将 Transformer 自注意力的 O(N²) 复杂度降到 O(N·logN) 或 O(N),支持更长上下文长度与更低推理成本的注意力机制家族总称。
系统提示词
System Prompt(系统提示词)是在对话消息列表里 role=system 的消息,用于设定模型人设、能力边界、输出格式、规则约束,位于 Prompt 最开头且通常跨多轮保持不变。
系统指纹
System Fingerprint 是 OpenAI 2024 年引入的响应字段(形如 fp_abc123),用于标识当前请求实际使用的底层模型检查点/配置快照;同模型名不同 fp 意味着输出分布有漂移,可复现性受影响。
消费上限
消费上限指 API 账号每月可花费的最大金额限制,分为服务商强制的层级消费上限和用户自设预算,防止意外超支。
语义路由 Semantic Router
基于用户查询的 embedding 语义相似度而非关键词匹配,将请求动态分发到不同知识库、模型、工具链或人工队列的 LLM 网关前置模块。
语义切片
Semantic Chunking 语义切片是 RAG 的文档切片策略:不是按固定字符数或 Token 数硬切,而是按语义完整单元切(一段、一节、一个论点),保持每个 Chunk 内部语义完整,显著提升检索召回率和回答准确率。
自博弈强化学习 Self-Play RLHF
在 RLHF 流程中引入模型自博弈生成训练样本,通过自我对弈或自我问答降低人工标注成本并提升复杂推理能力
自反思 Self-Reflection
LLM 在生成答案后或生成过程中,主动触发另一次(或多次)自我审视调用,对已生成内容进行评分、纠错、补全、优化,用额外计算量换取更高答案质量。
自洽性多路径投票
Self-Consistency 自洽性是思维链 CoT 的升级技巧:对同一个问题,用高 Temperature 采样生成 K 条(通常 5 至 40 条)不同的推理路径和答案,最后做答案投票选出票数最多的那个,数学或逻辑类任务准确率再提 10–20%。
T
变换器
Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。
采样温度
Temperature(采样温度)是 API 参数,用于控制模型生成 Token 时的随机性/创造性:值越低越确定和重复,值越高越发散和多样,典型取值 0 到 2 之间。
词元
词元(Token)是模型处理文本的最小语义单元,可以是一个汉字、一个英文单词,或一个字符片段。
词元(Token)预算与成本优化
Token 预算指企业在 AI API 调用上按日/月/年预先规划的最大 Token 消耗额度及分层优化策略,涵盖提示词工程、缓存、模型分级、结构化输出等多条技术路径。
分词器
Tokenizer(分词器)是把人类可读文本映射成模型能理解的整数 Token ID 的组件,是大模型 API 计费和输入处理的最前端,它决定了 1 个汉字等于多少 Token、1 段代码如何切分。
工具调用严格模式 Tool Calling Strict
工具调用严格模式是 OpenAI v3 API 及兼容平台(如 Anthropic Claude 3.5+、唯元智创)提供的 FC 执行保障机制:API 层面校验函数名和参数,100% 保证模型输出的工具调用与你声明的 schema 完全一致,字段缺漏和类型错误概率从 1% 至 2% 降到 < 0.5%。
工具调用与函数调用
工具调用是让 LLM 超越纯文本生成、通过结构化参数去调用外部能力(天气 API、计算器、知识库查询、代码执行)的能力,是智能体的核心基础模块。
核采样概率阈值
Top-P(核采样)是控制采样范围的参数:只保留累计概率达到 P 的最可能 Token 集合作为候选,从集合内按相对概率采样,典型值 0.1 至 0.95,是 Temperature 的常见替代方案。
令牌桶算法
令牌桶算法是 API 限流最常用的实现方式:按恒定速率向桶中补充令牌,请求需要消耗对应数量的令牌才允许通过,支持合理的流量突发。
每日 Token 数
TPD 是每日 Token 数的缩写,指 API 在 24 小时窗口内允许处理的输入+输出 Token 总量,是免费版和低配额账号的日级 Token 天花板。
迁移学习 Transfer Learning
将在大规模源任务(如全网文本/ImageNet图像)上预训练得到的模型知识,通过少量参数调整迁移到小规模目标任务(如企业客服分类/医疗影像诊断)的深度学习核心方法论,是当代大模型落地的默认范式。
首 Token 延迟
首 Token 延迟(TTFT)指从 API 请求发出到收到模型返回的第一个 Token 之间的时长,是衡量聊天交互流畅度的关键指标。
思维树
Tree of Thoughts(思维树 ToT)是超越 CoT/SC 的提示工程范式:把任务求解过程建模为一棵状态等于中间思考结果的搜索树,每一步用 LLM 做生成候选节点、评分剪枝、搜索(BFS/DFS/MCTS)三步,可完成规划、数学、创意写作等多步决策类任务。
Top-K 采样
Top-K 采样是大模型生成的一种解码策略:每一步只从概率最高的前 K 个候选 Token 里做随机采样,过滤掉长尾低概率选项,减少输出胡说八道同时保留多样性。
U
V
推理服务器 vLLM & SGLang
vLLM 与 SGLang 是当前 LLM 高吞吐推理的两大主流开源推理框架:通过 PagedAttention KV 缓存分页管理 + 连续批处理 Continuous Batching,把单机吞吐量提升 5 到 10 倍。
向量数据库
向量数据库专门存储高维浮点数向量(embedding)并提供近似最近邻 ANN 检索;是大模型 RAG 检索增强生成架构的核心组件,负责在百万级知识库中毫秒级召回与用户问题语义最相关的文档片段。