智泊AI--大模型基础
智泊AI–大模型基础
导读:本文梳理了大模型发展的关键节点、两大核心局限(幻觉、上下文窗口),并总结大模型应用开发的四条主流路线,是后续提示词与智能体课程的基石。
0.前言
之前一直在跟着 hello-agent 的 github 社区学习,但总觉得差点什么——没有完整的课程体系,也缺少专业的项目,总觉得差点意思。这次报了智泊的 AI 课程,一是巩固之前的知识,二是查清楚自己缺失的部分到底在哪里。
1.AI时代的开启
大模型并非凭空出现,以下几个标志性节点勾勒出 AI 从专用系统走向通用大模型的演进:
- 1997 年 · 深蓝(Deep Blue):以优势比分击败当时的世界国际象棋冠军,成为历史上第一个在标准比赛条件下击败世界冠军的计算机系统,特点是暴力搜索。
- 2016 年 · AlphaGo:以 4:1 大比分击败围棋冠军李世石,不再依赖暴力搜索,而是引入策略网络评估棋局、价值网络预测当前棋局胜率,并使用蒙特卡洛树搜索模拟未来可能的走法序列。至此,深度学习与强化学习走入 AI 的领域。
- 2022 年 · ChatGPT:1750 亿参数,使用 Transformer 架构,通过强化学习从人类反馈(RLHF)进行训练,能够理解上下文、生成连贯文本,实现回答问题和编写代码等任务。
- 2023 年 · DeepSeek:中国自主研发的大语言模型,支持中英文双语,在代码生成、数学推理、长文本处理等方面表现优异;开源模型降低了使用门槛。
目前主要是算力和硬件制约了大语言模型训练的参数规模。如果算力与硬件不断扩大,大模型会不会超越人类本身?这是有可能的事情——快进到 AI 给我当牛马……
2.大模型的幻觉
大模型的”编造”现象,也就是我们常说的幻觉问题,是指大模型生成看似合理但实际上完全错误、无中生有或与事实不符的现象。其产生原因主要如下:
- 概率预测机制:基于概率预测下一个词,而不是查询事实数据库,导致生成流畅但不准确的内容。
- 训练数据偏差:训练数据中的错误、偏见或过时的信息会被模型学习并复现。
- 缺乏事实核查:模型没有内置的事实核查机制,无法像人类一样验证信息的准确性。
应对办法:
- 交叉验证:对关键信息进行事实核查。
- 引用来源:要求模型提供信息来源。
- RAG 技术:结合外部知识库。
- 人工审核:重要决策需人工确认。
3.大模型上下文窗口
上下文窗口是指大模型一次能够处理的最大输入和输出文本长度(注意是输入 + 输出),通常以 token 为单位计量。可能导致的影响:
- 长文档处理困难:处理长篇报告、法律文书、学术论文时,可能遗忘前半部分内容。
- 多轮对话受限:长对话中,早期的对话内容会逐渐被挤出上下文窗口,导致连贯性下降。
- 复杂任务受限:需要大量上下文信息的复杂推理任务难以完成。
4.大模型应用开发的四个方向
大模型应用开发主要有四条路线,理解它们的定位与边界,是后续学习的主线:
| 方向 | 说明 |
|---|---|
| 掌握 Prompt | 提示词(Prompt)是用户输入给大模型的指令或问题,用于引导模型生成期望的输出。 |
| RAG | 检索增强生成,是一种结合信息检索和文本生成的技术框架。核心理念是在生成回答之前,先从外部知识库中检索相关信息,再基于这些信息生成回答,提升实时性、准确性和专业性。 |
| 智能体 Agent | 能够自主理解、规划、执行和反思的 AI 系统,除被动回答问题外,还能主动完成复杂任务。公式:智能体 = 大模型 + 工具 + 记忆 + 规划。 |
| 微调 Fine-tuning | 在预训练模型的基础上,用特定领域的数据进行进一步训练的过程,适用于医疗、法律、金融等专业领域。 |
5.小结
本课的几条核心认知:
- AI Agent 的本质,是按照人类自身的理解去收集数据、分析数据、给出结论。
- AI 是放大器——人的认知,决定了用 AI 的认知天花板。
- AI 是一个很牛的开发团队,但缺乏架构、工程管理相关的能力。
智泊AI--大模型基础
https://one-null-pointer.github.io/2026/08/04/智泊AI--大模型基础/