跳到主内容
概念 · 协议 · 方法论

AI 概念百科

MCP、RAG、Agent、Vibe Coding……AI 时代的核心概念通俗解释,程序员理解 AI 的知识库。

01 / 05概念
概念

ACU(Agent Compute Unit)

ACU(Agent Compute Unit)是异步编程 Agent 的计费单位:按「Agent 实际干活多久」而不是「用了多少 token」收钱。它把不可预测的模型消耗,换成了可预算的时间单价——代价是你买的是时间,不是结果。

ACUAgent 计费AI 编程
概念

Terminal-Bench

Terminal-Bench 考的是 Agent 在真实终端里把一件事做完的能力——装依赖、改配置、跑命令、排查报错直到验收通过。它补上了 SWE-bench 不考的「用机器」能力,但 2.1 与 4.0 分数不可直接比较。

Terminal-Bench基准测试AI 编程
概念

AI 助手(AI 管家)是什么:2026 个人智能体与实用工具

AI 助手(AI 管家)= 能理解目标并自主调用工具完成任务的智能体,区别于只能一问一答的聊天机器人。它可以是通用的(Manus),也可以是嵌在某产品里的专用助理(Coze、Dify)。

AI 助手AI 管家AI Agent
概念

Computer Use(计算机操控)

Computer Use 让 AI 模型「看屏幕截图 → 规划动作 → 模拟键鼠」来操作任意软件,而不是靠 API。它把 Agent 的能力从「有接口的软件」扩展到「任何带界面的软件」,是 GUI 自动化 / RPA 的下一形态;代价是延迟、精度与权限安全。

computer-useGUI 自动化agent
概念

Prompt Caching(提示缓存)

Prompt Caching 让 API 缓存提示里的「稳定前缀」(system 指令、长文档、few-shot 示例、对话历史),后续相同前缀的请求直接读缓存——写入约 1.25x 价、命中读仅 0.1x 价。它把「每次都重算的长上下文」变成「算一次、反复用」,是长系统提示 / RAG / 多轮对话省钱省延迟的关键手段。

prompt-caching上下文缓存推理成本
概念

Reasoning Model(推理模型)

Reasoning Model(推理模型)在给出答案前会先做一段「显式思考 / 内部推理链」,把难题拆步骤、自我校验,再输出结论。它用更高的延迟与算力换数学、代码、逻辑、规划类难题的正确率。代表有 OpenAI o 系列、DeepSeek-R1、Claude 扩展思考形态。选型关键是「难任务上推理模型,简单任务上普通模型」。

reasoning-model推理模型chain-of-thought
概念

Agent 记忆(Memory)

上下文窗口是 Agent 的短期记忆,装不下也留不久;长期记忆要把关键信息写进外部存储再按需检索。CLAUDE.md / AGENTS.md 是最朴素的长期记忆,也是当前工程上最有效的方案。

Agent 记忆Memory长期记忆
概念

BYOK(自带密钥)

BYOK = Bring Your Own Key:工具免费开源,模型 API 你自己接。它把模型选择权和成本控制权都还给开发者——代价是稳定性完全取决于你接的那条 API 的质量。

BYOKBring Your Own KeyAPI Key
概念

国产编程模型盘点

2026 年国产编程模型集体上桌:K2.7 Code 万亿参数开源、GLM-5.3 冲开源榜第一、Qwen3.8-Flash 激活 6B 推理 ¥1/百万、MiMo SWE-bench Pro 超 Claude Code。本文一张表看懂全家桶,按场景给选型路线。

国产大模型编程模型模型选型
概念

长上下文(Long Context)

上下文窗口是模型单次能吞下的 token 上限,2026 年已卷到 1M 甚至 1000 万;但 Context Rot 证明远未到上限质量就开始下滑——容量是错误的指标,信噪比才决定输出质量。

长上下文Context WindowContext Rot
概念

MoE(混合专家架构)

MoE 让每个 token 只激活一小部分参数——总参数决定知识容量,激活参数决定推理成本。2026 年 8 月 Qwen3.8-Flash(125B-A6B)与 GLM-5.3-Flash(320B-A18B)同日开源,国产模型正式从「堆参数」转向「效率军备」。

MoE混合专家模型架构
概念

SWE-bench

SWE-bench 用真实 GitHub issue + 单元测试验收考 AI 编程 Agent:自主定位、改代码、跑通测试。它是 AI 编程能力最硬的基准,也是 2026 年国产 Agent 硬刚 Claude Code 的主战场。

SWE-bench基准测试AI 编程
概念

具身智能

让 AI 拥有身体、在物理世界里感知-决策-行动的技术范式:大模型'大脑' + 运控'小脑' + 机器人本体,是 AI 从数字世界走向物理世界的载体。

具身智能Embodied AI机器人
概念

机器人基础模型

在海量多本体机器人数据上预训练、可零样本泛化到新任务/新硬件的通用模型,是具身智能从'专用 demo'走向'通用部署'的关键。

机器人基础模型Foundation Model具身智能
概念

Context Rot(上下文腐烂)

随着输入 token 增多,LLM 输出质量会持续下降——即便远没到上下文窗口上限。Chroma 实测 18 个前沿模型无一幸免。对编码 agent 而言,这是首要失败模式,比模型能力更关键。

Context Rot长上下文上下文工程
概念

AI Agent(智能体)

能自主感知环境、规划任务、调用工具、持续迭代的 AI 系统,从聊天机器人进化到能干活的数字员工。

Agent智能体工具调用
概念

Embedding(向量嵌入)

把文本、图片等数据转成高维向量,让机器能通过向量距离衡量语义相似度——RAG、搜索、推荐的基础。

Embedding向量语义搜索
概念

Function Calling(函数调用)

让大模型根据用户意图自动选择并调用外部函数/API 的能力。是 AI Agent 的基础能力,让模型从对话进化到行动。

Function Calling工具调用Agent
概念

Hallucination(幻觉)

大模型生成看似合理但事实上错误或虚构的内容。幻觉是 LLM 最大的可靠性挑战,无法完全消除,但可以通过多种方法缓解。

幻觉可靠性RAG
概念

Temperature 与 Top-P(采样参数)

控制 LLM 输出随机性的两个核心参数:Temperature 调节概率分布的平坦度,Top-P 限制候选词范围。

TemperatureTop-P采样
概念

Token(令牌)

大模型处理文本的最小单位。一个 Token 约等于 0.75 个英文单词或 1-2 个汉字。Token 数量决定 API 费用和上下文窗口占用。

Token基础概念定价
02 / 05架构
03 / 05工具
04 / 05方法论
方法论

Agentic Coding(智能体编程)

AI 不再只补全下一行,而是'拥有问题':自主规划、改文件、跑测试、提交 commit,开发者退到'提需求 + 审结果'。2026 年从补全/对话走向自主 Agent 的范式迁移。

Agentic Coding智能体编程AI编程
方法论

VLA 模型(视觉-语言-动作)

Vision-Language-Action 模型:把'看(视觉)''懂(语言)''做(动作)'端到端统一到一个模型里,是具身智能的核心技术路线,被誉为'机器人的 ChatGPT 时刻'。

VLAVision-Language-Action具身智能
方法论

Context Engineering(上下文工程)

通过精心设计 prompt 上下文(系统提示、示例、检索结果、工具定义)来最大化 LLM 表现的工程方法论。

Context EngineeringPrompt工程上下文窗口
方法论

Fine-tuning vs RAG

两种让大模型适应特定场景的方法对比:Fine-tuning 修改模型权重,RAG 引入外部知识。大多数场景应该用 RAG。

Fine-tuningRAG模型微调
方法论

LoRA(低秩适配)

Low-Rank Adaptation,一种高效微调方法:冻结原模型权重,只训练一个很小的低秩矩阵,大幅降低微调成本。

LoRA微调高效训练
方法论

Prompt Engineering(提示词工程)

通过精心设计提示词来引导 LLM 生成高质量输出的技术,包括 few-shot、CoT、角色设定、结构化输出等方法。

Prompt提示词CoT
方法论

Vibe Coding

用自然语言与 AI 对话式编程,开发者描述意图、AI 写代码,像指挥一个全栈工程师干活。

Vibe Coding编程方法论AI编程
05 / 05协议