AI 术语词典

从底层原理到前沿技术,快速读懂 AI 大模型领域的核心概念。

A

近邻检索(ANN)

ANN - Approximate Nearest Neighbor

ANN(近似最近邻检索)是向量数据库的核心检索范式:通过聚类、哈希、图索引等方式放弃一点点召回精度,换取比暴力精确检索快 100 到 1000 倍的查询速度。

应用程序接口

API (Application Programming Interface)

API(Application Programming Interface,应用程序接口)是一组定义软件组件之间交互方式的协议、工具和定义,用于让不同系统之间能够互相调用功能。

智能体

Agent

智能体(Agent)是具备自主感知、规划、决策和执行能力的 AI 系统,它以大语言模型为大脑,通过调用工具来完成复杂任务。

智能体记忆 Agent Memory

Agent Memory

智能体记忆是 Agent 框架中用于跨轮次、跨任务存储和检索历史信息的组件,分为感官记忆、短期/工作记忆、长期记忆三层,决定了 Agent 能否记住用户偏好、避免重复犯错以及完成多步长周期任务。

注意力机制

Attention Mechanism

注意力机制(Attention Mechanism)是一种让模型在处理序列数据时,动态地给不同位置分配不同权重的计算方法,是 Transformer 架构的核心组件。

自动扩缩容 Autoscaling

Autoscaling (HPA / VPA / KEDA / Queue-based)

根据实时负载指标自动增减计算资源副本数或规格,平衡服务性能与成本,避免流量高峰与低谷时的资源浪费或不足

自适应检索增强生成 Adaptive RAG

Adaptive RAG

根据用户问题的复杂度、领域、歧义度动态选择检索策略、召回深度和生成模型的 RAG 框架,避免所有问题一刀切使用相同链路。

AI 安全合规与数据隐私

AI Safety, Compliance & Data Privacy

AI 安全合规覆盖了模型输出内容安全、用户数据隐私、训练数据产权、跨境数据传输、可解释审计、算法备案、行业监管要求等一整套法律与工程治理体系。

AI 对齐

AI Alignment

AI 对齐(AI Alignment)是确保 AI 系统的行为与人类意图、价值观和长远利益保持一致的研究领域,是大模型安全研究的核心议题。

API 版本管理与兼容性

API Versioning & Backward Compatibility

API 版本管理是在 LLM 接口升级时,对路由、请求参数、模型名、响应结构做时间戳或版本号隔离,保证已有客户代码零改动即可继续运行的工程实践。

API 密钥

API Key

API Key(API 密钥)是一串用于鉴权的字符串,每次调用 API 时放在 Authorization: Bearer 请求头中,是计费、速率限制、权限隔离的核心凭证。

B

C

并发请求数

Concurrent Requests / In-Flight Requests

并发请求数指同一时刻正在等待响应、尚未完成的 API 请求总数(在飞请求),是 DeepSeek 等厂商采用的替代 RPM 的核心限流维度。

对比学习 Contrastive Learning

Contrastive Learning

一种通过在嵌入空间中「拉近正样本对、推远负样本对」来训练表征模型的自监督/弱监督学习范式,是当代文本嵌入、图像表征、多模态对齐的核心基础算法。

缓存命中

Cache Hit

缓存命中指 Prompt 前缀与近期请求完全一致时,服务商直接复用已计算好的 KV 缓存,大幅降低输入 Token 成本并减少延迟。

缓存未命中

Cache Miss

缓存未命中指 Prompt 前缀与服务端缓存记录匹配失败,模型需要从头重新计算所有输入 Token 的 KV 张量,无法享受折扣价格和加速。

计算机使用工具调用

Computer Use

Computer Use 计算机使用是 2024 年下半年以来的 Agent 新能力:模型不再只输出文字回答,而是像真人一样操作图形界面(点击、输入、滚动、快捷键、打开文件、写代码运行等),典型实现是 Anthropic Claude 3.5 Computer Use、OpenAI Operator 系列。

检查点

Checkpoint

Checkpoint(检查点)是模型训练过程中定期保存的模型权重快照,可用于断点续训、模型评估或版本回滚。

结构化抽取与模式约束解码

Constrained Decoding / Structured Output

模式约束解码是强制 LLM 输出严格符合 JSON Schema / XML DTD / 正则 / 函数调用参数等预定义格式的技术,保证下游系统可直接解析而无需写正则兜底。

内容审核(安全过滤)

Content Moderation / Safety Filter

内容审核(安全过滤)是 API 服务端或客户端对输入 Prompt 和输出文本进行自动合规审查的机制,命中违规分类会拒绝请求或打安全标签,是大模型上线的必选项。

熔断器

Circuit Breaker

熔断器(Circuit Breaker)是微服务稳定性设计模式:当某上游错误率/延迟持续超阈值时,自动在一段时间内直接失败,停止继续向坏上游投递请求,避免雪崩。

上下文窗口

Context Window

上下文窗口(Context Window)是指大语言模型在一次交互中能够记住和处理的最大文本长度,通常以 Token 数量来衡量。

上下文蒸馏与长上下文压缩

Context Distillation / Compression

上下文压缩是 RAG 与长文本场景中,在把检索结果或历史对话喂给 LLM 之前,用轻量模型或算法把冗余信息过滤、精简、摘要,显著降低输入 Token 成本并提升答案事实性的技术。

思维链

Chain-of-Thought (CoT)

Chain-of-Thought 思维链是一种提示工程技巧:通过在 Prompt 中展示「问题→详细推理步骤→答案」的少样本示例,或直接写一句「请一步步思考」,显著提升大模型在数学、逻辑、多跳推理任务上的准确率。

宪法 AI Constitutional AI

Constitutional AI (CAI)

通过一套明确的价值观原则(宪法)驱动模型自我修正,无需大规模人工标注即可完成安全与价值观对齐

余弦相似度

Cosine Similarity

余弦相似度(Cosine Similarity)是通过计算两个向量夹角的余弦值来衡量它们相似程度的指标,取值范围 [-1, 1],是 Embedding 检索的核心度量。

灾难性遗忘 Catastrophic Forgetting

Catastrophic Forgetting

迁移学习/持续学习中,模型在学习新任务新知识后,几乎完全丧失先前习得任务能力的经典现象,是大模型微调、多任务学习、终身学习领域最核心的挑战之一。

D

E

F

故障转移(回退)

Fallback / Failover

Fallback(故障转移/回退)指当主模型、主厂商或主上游不可用时,API 网关自动切换到备用模型/备用厂商的高可用策略,是生产级多模型接入的必备能力。

函数绑定 Function Binding

Function Binding / Function Handler Mapping

函数绑定是 Function Calling 协议落地工程中把模型输出的工具调用(name + arguments JSON)映射到你后端实际可执行代码函数的过程,包含参数校验、鉴权、超时控制、熔断、重试等一整套执行管道。

函数调用

Function Calling

函数调用(Function Calling)是指大语言模型能够理解外部工具(API/函数)的功能,并在需要时智能地输出参数,让程序去执行真实动作的能力。

免费额度

Free Tier / Credit Grant

免费额度(免费档)指厂商新注册账号可免费试用的赠金或配额,通常有严格的 RPM/TPM/RPD 限制与有效期,用于新手体验与技术选型验证。

模糊匹配 Fuzzy Match

Fuzzy Matching / Approximate String Matching

模糊匹配是衡量两个字符串/短语在「字面不完全相同但语义或拼写近似」场景下是否能判定为同一条目的技术,广泛用于同义词匹配、错别字纠错、用户 Query 归一化、实体去重、RAG 中拼写容错检索。

模型微调

Fine-Tuning

Fine-Tuning 微调是在一个已经预训练好的基础模型(Base Model)上,使用小规模领域特定数据继续训练若干步,让模型适配特定行业/任务/语气;相比只改 Prompt,微调能获得更稳定的能力提升。

频率惩罚

Frequency Penalty

Frequency Penalty 频率惩罚是 OpenAI 兼容 API 的采样参数(-2.0 ~ +2.0),对每个已出现 Token 的惩罚量与其出现次数成正比,专门抑制说话结巴、同一段文字无限复制粘贴、代码中 print(1) 连打等现象。

少样本学习

Few-Shot Learning

少样本学习(Few-Shot Learning)是指模型仅通过少量示例(通常 1-10 个)就能学会新任务的能力,是大模型 In-Context Learning 的核心表现。

FlashAttention 加速算子

FlashAttention

FlashAttention 是 Tri Dao 等人提出的 I/O 感知型 Attention 算子实现:通过分块计算(Tiling)+ SRAM 复用 + 反向重计算,在不改变输出数值的前提下把 Attention 速度提升 2–4 倍,显存占用减少数十倍,已被 vLLM 和 PyTorch 2.x 内置。

G

分组查询注意力

GQA (Grouped Query Attention)

分组查询注意力 GQA 介于 MHA 与 MQA 之间:Query 头数保持不变,多组 Query 共享同一组 K/V 头,相比 MHA 大幅节省 KV Cache 显存,相比 MQA 几乎无损保留输出质量。

输出安全护栏

Guardrails

Guardrails 护栏是指在 LLM 输入侧(Prompt 到达模型前)和输出侧(模型回答给用户前)加的一层可编程过滤器:按预设规则/小模型/正则/JSON Schema 检测并拦截恶意输入、越权操作、格式错误、违规输出,是 LLM 生产安全的最后一道闸门。

梯度裁剪 Gradient Clipping

Gradient Clipping

梯度裁剪是训练神经网络/大模型时防止梯度爆炸的关键稳定技巧:每一步计算完梯度后,当梯度的范数超过预设阈值时按比例缩小到阈值以内,保证训练不跑飞不出现 NaN Loss。

梯度检查点

Gradient Checkpointing

Gradient Checkpointing 梯度检查点(激活重计算)是一种经典的显存-算力折衷技巧:在前向传播时不保存所有层的激活值,只保存关键检查点;反向传播到这一段时重新算一遍激活值,换取 30–50% 的显存下降,代价是训练时长增加约 20%。

梯度累积 Gradient Accumulation

Gradient Accumulation (Grad Accum / GA)

梯度累积是在显存不足时,把原本一个大 Batch 的训练拆分成多个 Micro-Batch 分步算梯度并累积相加,等累积够等效大 Batch 之后才更新一次权重,用来在小显存 GPU 上模拟大 Batch 训练效果的技巧。

图检索增强生成 Graph RAG

Graph RAG

基于知识图谱结构组织检索单元的 RAG 变体,通过实体-关系三元组建模文档间关联,支持多跳推理与全局事实一致性。

图形处理单元

GPU (Graphics Processing Unit)

GPU(Graphics Processing Unit,图形处理单元)是一种专门为并行计算设计的处理器,是训练和推理大语言模型的核心硬件。

H

I

J

K

键值缓存

KV Cache (Key-Value Cache)

KV Cache 是大模型推理阶段为历史 Token 的 Key 和 Value 张量建立的缓存机制,让每个新 Token 无需重新计算整个历史序列,是推理加速、长上下文运行的底层基础。

知识图谱

Knowledge Graph (KG)

知识图谱 KG 是用实体-关系-实体三元组(SPO:Subject-Predicate-Object)组织知识的图结构;在 RAG 中补全多跳推理、消歧实体别名、发现隐含关系,是向量检索加关键词之外的第三大检索支柱。

知识蒸馏模型压缩

Knowledge Distillation (KD)

Knowledge Distillation 知识蒸馏是经典模型压缩技术:先训练一个大而准的教师模型,再让一个小得多的学生模型去拟合教师输出的 Softmax 软概率而非硬标签,在参数量降至 1/10 时保留教师 90% 以上的能力,是高吞吐场景的标配。

KTO 偏好对齐

KTO (Kahneman-Tversky Optimization)

KTO 是 2024 年提出的无需成对偏好的对齐算法:只需「被人类喜欢的样本」和「被人类讨厌的样本」两个集合,就能做偏好对齐,比 DPO 节省一半标注成本。

KV 缓存淘汰 KV Cache Eviction

KV Cache Eviction / KV Cache Management Policy

KV 缓存淘汰是在 GPU 显存不足、推理请求并发多的时候,以什么策略丢弃哪些 KV Cache 页来腾空间给新请求的调度策略,常见有 LRU、优先级分级、滑动窗口、分层分区,直接决定了单 GPU 的并发上限和 OOM 故障率。

L

大语言模型

LLM (Large Language Model)

大语言模型(LLM)是基于深度学习(特别是 Transformer 架构)训练的、拥有数十亿甚至上万亿参数的自然语言处理模型。

低秩自适应

LoRA (Low-Rank Adaptation)

LoRA(Low-Rank Adaptation,低秩自适应)是一种参数高效微调技术,通过冻结原模型权重、仅训练低秩分解矩阵,实现以极低显存/成本完成大模型微调。

端到端延迟

Latency (End-to-End Latency)

Latency(端到端延迟)指从用户发出请求到接收到完整回答的总耗时,由网络、排队、Prefill、Decode 四部分相加组成,是评估 API 真实体验的黄金指标。

对数概率

Logprobs (Log Probabilities)

Logprobs 是大模型对每个候选 Token 分配的概率的对数值(通常以 e 或 2 为底);API 暴露 logprobs 字段允许你拿到模型对「最可能的 Top-K 个 Token」各自打分,用于备选答案、置信度估计、困惑度计算、红队检测。

负载均衡

Load Balancing

负载均衡指将请求按策略分发到多个上游(多厂商、多密钥、多区域、多模型)以聚合容量、降低延迟、避免单点过载,是高并发 AI 应用的基础架构能力。

延迟百分位 Latency Percentile

Latency Percentile (P50 / P95 / P99 / TP999)

按概率分布统计的 API 响应延迟指标,用于衡量用户真实体验与系统尾部性能,而非只看平均值

长上下文窗口扩展(Long Context)

Long Context Window Scaling

长上下文扩展是把 LLM 原生支持的最大输入长度从 4K/8K Token,扩展到 128K、1M 甚至更长的系列技术组合,涵盖 RoPE 外推、YaRN、位置编码修改、KV Cache 优化。

LLM 可观测性 LLM Observability

LLM Observability & Tracing

借鉴后端 APM(应用性能监控)方法论,针对 LLM 应用的输入/输出、Token 消耗、延迟、成本、链路 Trace、幻觉、Guardrails 拦截率等 20+ 维度做全链路采集、可视化、告警与归因分析的工程体系,是生产级 LLM 应用 7x24 稳定运行的核心基础设施。

M

多模态大模型

Multimodal LLM

Multimodal 多模态指一类能同时理解和生成多种模态数据的大模型:不仅处理文本(Text),还能理解图片、音频、视频、3D、PDF 版式等;典型接口如 vision chat、speech-to-text、text-to-image、video understanding。

多模态大模型

Multimodal LLM (MLLM / VLM)

多模态大模型(VLM / MLLM)是除了纯文本之外,能同时理解和生成图片、音频、视频、PDF 表格、结构化文档等多种模态输入输出的统一大模型架构。

多区域部署与容灾

Multi-Region & DR - Disaster Recovery

多区域部署指在多个云地域(Region)独立运行多套推理集群,任一区域故障时通过流量切换 / 多活实现业务不中断;容灾 RPO/RTO 指标直接决定故障恢复能力。

多智能体协作(Multi-Agent Orchestration)

Multi-Agent - Orchestration / Coordination

多智能体协作通过把一个复杂任务拆成多个独立角色的 Agent(检索/代码/数学/审核)分别处理,再由调度器按图结构编排传递结果,比单 LLM 一次生成质量提升显著。

混合精度训练 Mixed Precision Training (AMP)

Mixed Precision Training / Automatic Mixed Precision (AMP)

混合精度训练是在训练神经网络时,把不同的计算(矩阵乘/Attention)用 FP16/BF16,其他容易溢出的计算(Loss 缩放、Softmax、梯度累加)保留 FP32,以此来把训练显存砍半、Tensor Core 计算速度翻倍且不损失精度的通用技巧。

混合专家架构

MoE (Mixture of Experts)

混合专家 MoE 是一种大模型稀疏激活架构:将一个巨大的前馈网络拆成 N 个并行专家子网络,每次推理只由 Router 选出 Top-K 个专家参与计算,同等参数量下速度翻倍。

每分钟 Token 数

TPM (Tokens Per Minute)

TPM 是每分钟 Token 数的缩写,指 API 在 60 秒窗口内允许处理的 Token 总量,通常包含输入和输出 Token,是长上下文场景最关键的速率限制。

每分钟请求数

RPM (Requests Per Minute)

RPM 是每分钟请求数的缩写,指 API 接口在 60 秒滑动窗口内允许的最大调用次数,是大模型服务商最常用的速率限制指标。

每分钟输出 Token 数

OTPM (Output Tokens Per Minute)

OTPM 是每分钟输出 Token 数的缩写,指模型在 60 秒窗口内允许生成的输出 Token 总量,是长文本生成、代码补全场景的关键速率指标。

每分钟输入 Token 数

ITPM (Input Tokens Per Minute)

ITPM 是每分钟输入 Token 数的缩写,指 API 在 60 秒窗口内允许接收的输入 Token 总量(含 Prompt、System Message、文档上下文),是 RAG 与长对话场景的关键瓶颈。

模型卡片

Model Card

Model Card 模型卡片是一份标准化文档(一般由模型发布方维护),公开披露一个大模型的基本信息:大小、架构、训练数据范围、评估分数、已知偏见/风险、推荐用法与禁用场景;便于消费方选型与合规。

模型融合 Model Merging

Model Merging (Weight Ensembling)

无需重新训练,通过权重线性或非线性组合融合多个独立微调模型的能力,低成本获得多任务强模型

深度混合 Mixture of Depths

Mixture of Depths / MoD

由 Google DeepMind 2024 年提出的动态路由稀疏化 Transformer 架构:每个 token 在每层前向传播时由路由器决定「只走这一层做计算」还是「跳过这一层直接复用前面的输出」,用平均更少的 FLOPs 实现更深模型的等效能力。

最大输出 Token 数

Max Output Tokens

最大输出 Token 数(max_tokens / max_completion_tokens)指单次 API 请求允许模型生成的输出 Token 上限,防止输出过长或控制成本。

N

O

P

存在惩罚

Presence Penalty

Presence Penalty 存在惩罚是 OpenAI 兼容 API 的一个采样参数(-2.0 ~ +2.0),正数值会给**本轮对话中已经出现过一次以上的 Token** 额外加负对数偏置,鼓励模型聊新话题、不要原地打转。

规划执行 Plan-and-Execute

Plan-and-Execute Agent

智能体架构中明确区分「规划阶段」和「执行阶段」的两阶段范式:先由规划器产出多步结构化计划,再由执行器按计划逐项调用工具,避免边想边做的漂移。

近端策略优化

PPO (Proximal Policy Optimization)

PPO(近端策略优化)是 ChatGPT 时代强化学习对齐环节的标准算法:通过对策略更新幅度做 clip 裁剪约束,在保持训练稳定的前提下最大化奖励信号。

困惑度

PPL (Perplexity)

PPL 困惑度是衡量语言模型「对一段文本预测得有多准」的经典指标:数值越低越好,PPL=10 表示模型下一步平均在 10 个等概率候选中做选择;PPL 与平均负对数似然成指数关系。

每百万 Token 计价

Per-Million-Tokens Pricing

每百万 Token($/M、元/M)是大模型 API 的标准报价单位,按实际消耗的 Token 数乘以每百万单价计费。

前缀缓存 Prefix Caching

Prefix Caching / Prompt Prefix Sharing

前缀缓存是把多个不同请求之间相同的 System Prompt / Tool Schema / 长文档上下文这类公共前缀的 KV Cache 预先算好持久化缓存,后续请求直接复用而不再重复计算,能让长 System Prompt 场景下的 TTFT 和总 Token 成本下降 30% 至 80%。

提示版本管理 Prompt Versioning

Prompt Engineering Version Control

借鉴软件工程代码版本管理思想,对 LLM 应用中的 Prompt 模板、Few-shot 示例、模型参数、RAG 配置等进行版本化存储、A/B 实验、灰度发布、自动回滚的工程化体系,是 LLM 应用从 Demo 到生产必须补上的基础设施。

提示词

Prompt

提示词(Prompt)是用户输入给大语言模型的文本指令,可以是问题、任务描述、上下文或示例,是 LLM 时代最核心的「编程语言」。

提示词工程

Prompt Engineering

提示词工程(Prompt Engineering)是指通过设计、优化和迭代输入给大语言模型的文本(Prompt),来引导模型输出更高质量、更符合预期的结果的一门技术。

提示词缓存

Prompt Caching

提示词缓存是服务商在服务端保存 Prompt 前缀的 KV 张量缓存机制,匹配时直接复用已计算结果,降低成本并显著缩短首Token延迟。

提示词越狱与红队测试

Prompt Injection / Jailbreak & Red Teaming

提示词越狱是恶意用户通过构造特殊输入绕过模型安全对齐、诱导其输出违禁内容的攻击;红队测试则是主动模拟这类攻击来发现并修补安全漏洞的防御性工作。

提示词注入攻击

Prompt Injection

提示词注入 Prompt Injection 是一类针对 LLM 的攻击手法:攻击者在用户输入中嵌入恶意指令,诱使模型绕过 System Prompt 执行越权操作(泄露提示词、调用危险函数、输出违规内容)。

提示链 Prompt Chaining

Prompt Chaining

将复杂任务拆解为多个依序执行的 LLM 子调用,前一个子任务的结构化输出作为后一个子任务的输入,通过分而治之降低单次生成的错误率。

预填充阶段

Prefill Phase

Prefill(预填充)是大模型推理的第一阶段:并行处理全部输入 Prompt,计算出所有输入 Token 的 KV 缓存和第一个输出 Token 的概率分布,决定了首 Token 延迟(TTFT)。

Q

R

基于人类反馈的强化学习

RLHF (Reinforcement Learning from Human Feedback)

RLHF(Reinforcement Learning from Human Feedback)是利用人类对模型输出的偏好排序训练奖励模型,再通过强化学习优化大模型的技术,是 ChatGPT 引爆的关键。

检索增强生成

RAG (Retrieval-Augmented Generation)

检索增强生成(RAG)是一种结合了信息检索和文本生成的技术,旨在让大语言模型基于外部知识库给出准确回答,从而减少幻觉。

奖励模型

RM (Reward Model)

奖励模型 RM 是 RLHF 三阶段中的中间桥梁:基于人类偏好排序数据训练,输入一段模型输出即可输出一个 0 至 10 分的偏好分数,为 PPO 强化学习阶段提供可微分的奖励信号。

路由大模型 Router LLM

Router LLM (Mixture-of-Experts Routing)

在多模型或多专家架构中,根据请求特征自动将流量路由到最合适的模型或专家,实现成本与效果的最优平衡

每秒请求数

RPS (Requests Per Second)

RPS 每秒请求数衡量 API 系统实际吞吐能力:1 秒内成功处理的请求(非 Token)数量;和 RPM 的关系是 RPS = RPM ÷ 60。RPS 是 API 网关容量规划、SLA 承诺、压测的核心指标。

每日请求数

RPD (Requests Per Day)

RPD 是每日请求数的缩写,指 API 在 24 小时滚动或日切窗口内允许的总调用次数,是免费档、低档位账号最常见的硬性日配额天花板。

速率限制

Rate Limit

速率限制是 API 服务商为防止滥用、保障公平性对单位时间内调用量或 Token 量设置的硬性上限,超限通常返回 HTTP 429。

旋转位置编码

RoPE (Rotary Position Embedding)

RoPE 旋转位置编码是 LLaMA/GPT-NeoX 等现代模型主流使用的相对位置编码方案:通过对 Query 和 Key 的向量空间进行复数域旋转,把位置信息注入注意力计算中,天然具备长度外推能力。

重排精排

Rerank

Rerank 重排也叫精排,是 RAG 检索增强生成链路最后一段:把粗召回阶段(向量检索/关键词检索)返回的 Top-20 至 50 个候选片段,用交叉注意力模型重新打分排序,选出 Top-3 至 5 最相关的喂给大模型。

AI反馈强化学习

RLAIF (Reinforcement Learning from AI Feedback)

RLAIF AI 反馈强化学习是 RLHF 的低成本替代方案:不用人类标注员一条条打偏好对,而是用强的裁判模型 L Judge 自动生成偏好数据,再用 DPO/PPO 做对齐,效果接近 RLHF 但成本下降 90%,是当前开源对齐的主流方案。

ReAct 推理行动范式

ReAct (Reasoning + Acting)

ReAct(Reasoning + Act 推理与行动)是 2022 年 Google 提出的 Agent 经典工作流:交替进行思考推理(Thought)、调用工具或行动(Action)、观察结果(Observation)三段循环,直至得出最终答案,是现代 LLM Agent 框架的基础模式。

S

服务等级协议

SLA (Service Level Agreement)

SLA 服务等级协议是 AI API 供应商与客户之间的正式承诺:一般以月度可用性百分比(如 99.9%)、首字延迟 P95、错误率为核心指标,未达标时按比例退款或抵扣下月账单。

服务等级协议 SLA & 可用性

SLA - Service Level Agreement

服务等级协议 SLA 是 API 服务商与客户之间承诺的可用性/延迟/错误率等量化指标及违约赔偿机制,99.9%/99.95%/99.99% 对应不同停机时长。

合成数据 Synthetic Data

Synthetic Data Generation

由 LLM、GAN、规则引擎或物理仿真器自动生成的人工训练数据,用于在真实标注数据不足、昂贵或存在隐私风险时扩展训练集并提升模型鲁棒性。

滑窗注意力 Sliding Window Attention

Sliding Window Attention / SWA

稀疏注意力中最常用、工程性价比最高的一种特例:规定每个 token 只能关注其自身以及向前追溯的最近 W 个相邻 token(W 为窗口大小,通常 4096 或 8192),实现 O(N·W)≈O(N) 的线性复杂度。

监督微调

SFT (Supervised Fine-Tuning)

SFT(监督微调)是在通用基模型上用高质量任务数据集(问答、指令遵循、对话等)做有监督微调的训练环节,是 RLHF、DPO 等对齐流程的前置基础步骤。

结构化输出

Structured Outputs (JSON Mode)

结构化输出指一类 API 能力:通过 response_format、JSON Schema 等参数约束模型 100% 返回合法 JSON/指定格式,避免空白字符、语法错误、字段缺失。

流式输出

Streaming Output (SSE)

流式输出是 API 按 Server-Sent Events(SSE)协议逐 Token 返回结果的响应方式,让用户能边生成边阅读,显著改善交互体感。

每秒 Token 数

TPS (Tokens Per Second)

TPS 是每秒 Token 数的缩写,指模型生成输出的实时速度,直接决定聊天界面流式输出的流畅度与用户体验。

随机种子

Seed Parameter

Seed(随机种子)是 API 整数参数,指定后模型采样过程将尽量保持确定性,相同的 seed + 相同参数 + 相同输入理论上返回相同输出,用于测试、A/B、可复现流程。

缩放定律 Scaling Laws

Neural Scaling Laws

预训练大模型时,模型最终损失 / 下游任务表现与「参数量 N、训练数据量 D、训练计算量 C」三个核心变量在双对数坐标下呈可预测的幂律线性关系,是大模型时代投资规划、训练预算分配的核心指导理论。

停止序列

Stop Sequence / Stop

Stop Sequence(停止序列)是字符串数组,作为生成终止信号;模型一旦命中其中任何一个字符串就立刻停输,常用于 JSON 收尾、对话段结束,避免无限续写。

投机解码

Speculative Decoding

投机解码 Speculative Decoding 是一种推理加速方法:先用一个小而快的草稿模型猜测未来 K 个 Token,再用大模型一次性并行验证,猜对了就整段跳过,实测 TPS 提升 2–4 倍不损失输出分布。

稀疏注意力 Sparse Attention

Sparse Attention

通过只计算 query 与 key 的一部分子集的注意力权重(而非全部 N×N 对),将 Transformer 自注意力的 O(N²) 复杂度降到 O(N·logN) 或 O(N),支持更长上下文长度与更低推理成本的注意力机制家族总称。

系统提示词

System Prompt

System Prompt(系统提示词)是在对话消息列表里 role=system 的消息,用于设定模型人设、能力边界、输出格式、规则约束,位于 Prompt 最开头且通常跨多轮保持不变。

系统指纹

System Fingerprint

System Fingerprint 是 OpenAI 2024 年引入的响应字段(形如 fp_abc123),用于标识当前请求实际使用的底层模型检查点/配置快照;同模型名不同 fp 意味着输出分布有漂移,可复现性受影响。

消费上限

Spend Limit / Monthly Budget

消费上限指 API 账号每月可花费的最大金额限制,分为服务商强制的层级消费上限和用户自设预算,防止意外超支。

语义路由 Semantic Router

Semantic Router

基于用户查询的 embedding 语义相似度而非关键词匹配,将请求动态分发到不同知识库、模型、工具链或人工队列的 LLM 网关前置模块。

语义切片

Semantic Chunking

Semantic Chunking 语义切片是 RAG 的文档切片策略:不是按固定字符数或 Token 数硬切,而是按语义完整单元切(一段、一节、一个论点),保持每个 Chunk 内部语义完整,显著提升检索召回率和回答准确率。

自博弈强化学习 Self-Play RLHF

Self-Play Reinforcement Learning from Human Feedback

在 RLHF 流程中引入模型自博弈生成训练样本,通过自我对弈或自我问答降低人工标注成本并提升复杂推理能力

自反思 Self-Reflection

Self-Reflection / Reflexion

LLM 在生成答案后或生成过程中,主动触发另一次(或多次)自我审视调用,对已生成内容进行评分、纠错、补全、优化,用额外计算量换取更高答案质量。

自洽性多路径投票

Self-Consistency (SC)

Self-Consistency 自洽性是思维链 CoT 的升级技巧:对同一个问题,用高 Temperature 采样生成 K 条(通常 5 至 40 条)不同的推理路径和答案,最后做答案投票选出票数最多的那个,数学或逻辑类任务准确率再提 10–20%。

T

变换器

Transformer

Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。

采样温度

Temperature

Temperature(采样温度)是 API 参数,用于控制模型生成 Token 时的随机性/创造性:值越低越确定和重复,值越高越发散和多样,典型取值 0 到 2 之间。

词元

Token

词元(Token)是模型处理文本的最小语义单元,可以是一个汉字、一个英文单词,或一个字符片段。

词元(Token)预算与成本优化

Token Budgeting & Optimization

Token 预算指企业在 AI API 调用上按日/月/年预先规划的最大 Token 消耗额度及分层优化策略,涵盖提示词工程、缓存、模型分级、结构化输出等多条技术路径。

分词器

Tokenizer

Tokenizer(分词器)是把人类可读文本映射成模型能理解的整数 Token ID 的组件,是大模型 API 计费和输入处理的最前端,它决定了 1 个汉字等于多少 Token、1 段代码如何切分。

工具调用严格模式 Tool Calling Strict

Tool Calling Strict Mode

工具调用严格模式是 OpenAI v3 API 及兼容平台(如 Anthropic Claude 3.5+、唯元智创)提供的 FC 执行保障机制:API 层面校验函数名和参数,100% 保证模型输出的工具调用与你声明的 schema 完全一致,字段缺漏和类型错误概率从 1% 至 2% 降到 < 0.5%。

工具调用与函数调用

Tool Use / Function Calling

工具调用是让 LLM 超越纯文本生成、通过结构化参数去调用外部能力(天气 API、计算器、知识库查询、代码执行)的能力,是智能体的核心基础模块。

核采样概率阈值

Top-P (Nucleus Sampling)

Top-P(核采样)是控制采样范围的参数:只保留累计概率达到 P 的最可能 Token 集合作为候选,从集合内按相对概率采样,典型值 0.1 至 0.95,是 Temperature 的常见替代方案。

令牌桶算法

Token Bucket Algorithm

令牌桶算法是 API 限流最常用的实现方式:按恒定速率向桶中补充令牌,请求需要消耗对应数量的令牌才允许通过,支持合理的流量突发。

每日 Token 数

TPD (Tokens Per Day)

TPD 是每日 Token 数的缩写,指 API 在 24 小时窗口内允许处理的输入+输出 Token 总量,是免费版和低配额账号的日级 Token 天花板。

迁移学习 Transfer Learning

Transfer Learning

将在大规模源任务(如全网文本/ImageNet图像)上预训练得到的模型知识,通过少量参数调整迁移到小规模目标任务(如企业客服分类/医疗影像诊断)的深度学习核心方法论,是当代大模型落地的默认范式。

首 Token 延迟

TTFT (Time To First Token)

首 Token 延迟(TTFT)指从 API 请求发出到收到模型返回的第一个 Token 之间的时长,是衡量聊天交互流畅度的关键指标。

思维树

Tree of Thoughts (ToT)

Tree of Thoughts(思维树 ToT)是超越 CoT/SC 的提示工程范式:把任务求解过程建模为一棵状态等于中间思考结果的搜索树,每一步用 LLM 做生成候选节点、评分剪枝、搜索(BFS/DFS/MCTS)三步,可完成规划、数学、创意写作等多步决策类任务。

Top-K 采样

Top-K Sampling

Top-K 采样是大模型生成的一种解码策略:每一步只从概率最高的前 K 个候选 Token 里做随机采样,过滤掉长尾低概率选项,减少输出胡说八道同时保留多样性。

U

V

W

Z