文章

AI 技术沉淀 | 第0篇:目前我对AI的理解

AI 技术沉淀 | 第0篇:目前我对AI的理解

阅读引导

第一部分是我写的,图是手工画的。第二部分是gpt5.5 medium写的,如果理解第一部分,第二部分应该也很好理解阅读无压力


一、核心内容(what我写的)

当前我对AI的理解:

  1. LLM 是一个数学函数,$f(x) = ax + bx + c$。 其中 a/b/c 为参数, 输入字符x,得到目标f(x), 不同的模型对应的参数不一样,函数曲线也就不一样。要想得到这个函数,目前没有数学办法得到它,靠现实中的大量的数据集,一轮一轮的穷举炼丹,通过各种统计学方法来评测炼出来的函数是不是真的能在现实中类似的场景下做出合理预测
  2. LLM 是代码中的一段method/function, 是的,我认为数学函数就是method,有入参,有出参,有if/for 等逻辑。但是这个方法有个特性,它是逻辑函数,什么时候用的什么数据炼出来的,他的内容/逻辑就止步于那时。
  3. 想解决LLM 这个method 能力有限的方法是封装,传统软件工程那一套,在这个method外边写before逻辑,写after逻辑,也可以写aroud逻辑。这些封装逻辑,可以做查网络数据、增加沙箱环境执行等,你想增加的东西。但是纯LLM公司会愿意增加这些乱七八糟的能力吗?不愿意,因为要满足全球通用,太难了
  4. 如果在LLM外封装一层,叫 handler 的东西,用法是,用户在调用的模型的时候,将希望模型在遇到xxx的情况下,可以使用yyy这个工具,这个工具你没有没关系,用户这里有,LLM只管返回你需要用什么工具即可 (像不像skill)
  5. agent 本质是使用工程技术,解决LLM的能力不足(炼出即巅峰、孤立的函数、概率带来的不确定性),agent 核心是一个loop循环,用户输入提示词 + 本地能提供的skill(tool) 一起调用LLM,LLM判断是否需要skill,如果需要,则在用户侧触发skill指向的工具(web_search等)。如果不需要skill,则LLM给出信息到用户,用户下一轮对话,将历史对话一起带给LLM,所以当多轮对话之后,输入的信息就太多了,要有一定的机制压缩、丢弃以前的信息(对比redis等各种缓存的过期策略比较好理解)

LLM 基础理解图


二、AI 助手补充版:我会怎样理解 LLM 和 Agent

如果从更偏技术实现的角度看,LLM 可以理解成一个极其复杂的概率函数:

\[f(\text{tokens}, \text{parameters}) \rightarrow P(\text{next token})\]

它接收的不是完整意义上的“文字”,而是经过 tokenizer 切分后的 token 序列。模型根据当前上下文,计算下一个 token 出现的概率分布,然后通过采样策略一步一步生成最终回答。

所以,LLM 和传统代码里的 method/function 有相似之处:都有输入、输出和内部参数。但它们也有明显区别:

  1. 传统函数通常是确定性的:相同输入,得到相同输出。
  2. LLM 更像概率函数:相同输入,在不同 temperature、top_p 等采样参数下,可能得到不同输出。
  3. 传统函数的逻辑通常由人显式写出,比如 if/for/switch。
  4. LLM 的“逻辑”不是显式业务代码,而是训练过程中沉淀在大量参数里的统计规律。

LLM 本体的能力边界也很明显:

  1. 知识截止:模型训练完成后,本体知识基本停留在训练数据覆盖的时间点。
  2. 上下文有限:模型只能看到当前上下文窗口里的内容,看不到窗口外的历史。
  3. 输出不稳定:它是在生成概率最高或较合理的 token,不是在执行严格的业务规则。
  4. 不能天然行动:LLM 本身只会生成文本,不会自动查数据库、访问网页、运行代码或操作系统。

因此,Agent 可以理解成包在 LLM 外面的一套工程系统。它不是单纯问一次模型,而是一个循环:

1
用户输入 -> 构造上下文 -> 调用 LLM -> 判断是否需要工具 -> 执行工具 -> 读取结果 -> 再次调用 LLM -> 输出结果

在这个循环里,LLM 更像“大脑”或“决策器”,工具是“手脚”,上下文管理是“记忆系统”,而 Agent 框架负责把它们组织起来。

RAG 也是类似思路。它不是重新训练模型,而是在调用 LLM 之前,先从搜索引擎、知识库、数据库或本地文件中检索相关信息,再把这些信息塞进上下文里,让模型基于新资料回答。也就是说:

1
2
RAG = 检索外部资料 + 把资料作为上下文提供给 LLM
Agent = LLM + 工具 + 记忆 + 循环 + 执行控制

我会把它们分成三个层次:

  1. LLM:底层概率模型,负责根据上下文生成 token。
  2. ChatBot:把 LLM 包装成对话产品,重点是聊天体验。
  3. Agent:在 LLM 外面加工具、记忆、规划和执行循环,让它能完成更复杂的任务。

所以我的总结是:LLM 是能力核心,但不是完整应用;Agent 是把 LLM 变成可执行系统的工程封装。


本文由作者按照 CC BY 4.0 进行授权