AI 概念百科
MCP、RAG、Agent、Vibe Coding……AI 时代的核心概念通俗解释,程序员理解 AI 的知识库。
ACU(Agent Compute Unit)
ACU(Agent Compute Unit)是异步编程 Agent 的计费单位:按「Agent 实际干活多久」而不是「用了多少 token」收钱。它把不可预测的模型消耗,换成了可预算的时间单价——代价是你买的是时间,不是结果。
Terminal-Bench
Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。
AI 助手(AI 管家)是什么:2026 个人智能体与实用工具
AI 助手(AI 管家)= 能理解目标并自主调用工具完成任务的智能体,区别于只能一问一答的聊天机器人。它可以是通用的(Manus),也可以是嵌在某产品里的专用助理(Coze、Dify)。
Computer Use(计算机操控)
Computer Use 让 AI 模型「看屏幕截图 → 规划动作 → 模拟键鼠」来操作任意软件,而不是靠 API。它把 Agent 的能力从「有接口的软件」扩展到「任何带界面的软件」,是 GUI 自动化 / RPA 的下一形态;代价是延迟、精度与权限安全。
Prompt Caching(提示缓存)
Prompt Caching 让 API 缓存提示里的「稳定前缀」(system 指令、长文档、few-shot 示例、对话历史),后续相同前缀的请求直接读缓存——写入约 1.25x 价、命中读仅 0.1x 价。它把「每次都重算的长上下文」变成「算一次、反复用」,是长系统提示 / RAG / 多轮对话省钱省延迟的关键手段。
Reasoning Model(推理模型)
Reasoning Model(推理模型)在给出答案前会先做一段「显式思考 / 内部推理链」,把难题拆步骤、自我校验,再输出结论。它用更高的延迟与算力换数学、代码、逻辑、规划类难题的正确率。代表有 OpenAI o 系列、DeepSeek-R1、Claude 扩展思考形态。选型关键是「难任务上推理模型,简单任务上普通模型」。
Agent 记忆(Memory)
上下文窗口是 Agent 的短期记忆,装不下也留不久;长期记忆要把关键信息写进外部存储再按需检索。CLAUDE.md / AGENTS.md 是最朴素的长期记忆,也是当前工程上最有效的方案。
BYOK(自带密钥)
BYOK = Bring Your Own Key:工具免费开源,模型 API 你自己接。它把模型选择权和成本控制权都还给开发者——代价是稳定性完全取决于你接的那条 API 的质量。
国产编程模型盘点
2026 年国产编程模型集体上桌:K2.7 Code 万亿参数开源、GLM-5.3 冲开源榜第一、Qwen3.8-Flash 激活 6B 推理 ¥1/百万、MiMo SWE-bench Pro 超 Claude Code。本文一张表看懂全家桶,按场景给选型路线。
长上下文(Long Context)
上下文窗口是模型单次能吞下的 token 上限,2026 年已卷到 1M 甚至 1000 万;但 Context Rot 证明远未到上限质量就开始下滑——容量是错误的指标,信噪比才决定输出质量。
MoE(混合专家架构)
MoE 让每个 token 只激活一小部分参数——总参数决定知识容量,激活参数决定推理成本。2026 年 8 月 Qwen3.8-Flash(125B-A6B)与 GLM-5.3-Flash(320B-A18B)同日开源,国产模型正式从「堆参数」转向「效率军备」。
SWE-bench
SWE-bench 用真实 GitHub issue + 单元测试验收考 AI 编程 Agent:自主定位、改代码、跑通测试。它是 AI 编程能力最硬的基准,也是 2026 年国产 Agent 硬刚 Claude Code 的主战场。
具身智能
让 AI 拥有身体、在物理世界里感知-决策-行动的技术范式:大模型'大脑' + 运控'小脑' + 机器人本体,是 AI 从数字世界走向物理世界的载体。
机器人基础模型
在海量多本体机器人数据上预训练、可零样本泛化到新任务/新硬件的通用模型,是具身智能从'专用 demo'走向'通用部署'的关键。
Context Rot(上下文腐烂)
随着输入 token 增多,LLM 输出质量会持续下降——即便远没到上下文窗口上限。Chroma 实测 18 个前沿模型无一幸免。对编码 agent 而言,这是首要失败模式,比模型能力更关键。
AI Agent(智能体)
能自主感知环境、规划任务、调用工具、持续迭代的 AI 系统,从聊天机器人进化到能干活的数字员工。
Embedding(向量嵌入)
把文本、图片等数据转成高维向量,让机器能通过向量距离衡量语义相似度——RAG、搜索、推荐的基础。
Function Calling(函数调用)
让大模型根据用户意图自动选择并调用外部函数/API 的能力。是 AI Agent 的基础能力,让模型从对话进化到行动。
Hallucination(幻觉)
大模型生成看似合理但事实上错误或虚构的内容。幻觉是 LLM 最大的可靠性挑战,无法完全消除,但可以通过多种方法缓解。
Temperature 与 Top-P(采样参数)
控制 LLM 输出随机性的两个核心参数:Temperature 调节概率分布的平坦度,Top-P 限制候选词范围。
Token(令牌)
大模型处理文本的最小单位。一个 Token 约等于 0.75 个英文单词或 1-2 个汉字。Token 数量决定 API 费用和上下文窗口占用。
多 Agent 编排(Agent Orchestration)
用一个协调层(coordinator)把大目标拆成子任务、派发给多个 Agent 并行跑、再把结果收拢起来的架构模式。它解决的是「单个 Agent 串行跑太慢、多个 Agent 手工协调太累」的问题,代价是集成负载与成本线性上升。
LLM Wiki (大语言模型维基知识库)
Andrej Karpathy 提出的新型知识管理范式:将大模型作为知识编译器,把原始资料预编译为结构化 Markdown 维基,取代传统 RAG 的即时检索模式。
RAG (检索增强生成)
Retrieval-Augmented Generation,让 AI 在生成回答前先从知识库检索相关信息,解决大模型知识过时和幻觉问题。
Agentic Coding(智能体编程)
AI 不再只补全下一行,而是'拥有问题':自主规划、改文件、跑测试、提交 commit,开发者退到'提需求 + 审结果'。2026 年从补全/对话走向自主 Agent 的范式迁移。
VLA 模型(视觉-语言-动作)
Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。
Context Engineering(上下文工程)
通过精心设计 prompt 上下文(系统提示、示例、检索结果、工具定义)来最大化 LLM 表现的工程方法论。
Fine-tuning vs RAG
两种让大模型适应特定场景的方法对比:Fine-tuning 修改模型权重,RAG 引入外部知识。大多数场景应该用 RAG。
LoRA(低秩适配)
Low-Rank Adaptation,一种高效微调方法:冻结原模型权重,只训练一个很小的低秩矩阵,大幅降低微调成本。
Prompt Engineering(提示词工程)
通过精心设计提示词来引导 LLM 生成高质量输出的技术,包括 few-shot、CoT、角色设定、结构化输出等方法。
Vibe Coding
用自然语言与 AI 对话式编程,开发者描述意图、AI 写代码,像指挥一个全栈工程师干活。
ACP (Agent Client Protocol)
Zed 提出的开放协议,标准化代码编辑器与 AI 编码 agent 之间的通信。用 JSON-RPC 2.0 跑在 stdio 上,让任何 ACP agent 能在任何 ACP 编辑器里用——相当于 AI agent 版的 LSP。
AGENTS.md
给 AI 编码 agent 看的项目说明文件:用一个放在仓库根目录的 Markdown 文件,告诉 agent 怎么装依赖、怎么跑测试、有哪些约定。被 6 万+ 项目采用,已成跨工具事实标准。
A2A (Agent-to-Agent Protocol)
Google 提出的 Agent 间通信协议,让不同平台、不同框架的 AI Agent 能互相发现、协商、协作。
MCP (Model Context Protocol)
Anthropic 推出的开放协议,让 AI 模型标准化地连接外部工具、数据源和 API,类似于 AI 的 USB-C 接口。