在AI技术飞速发展的2026年,各类专业术语层出不穷。从ChatGPT到智能体,从RAG到MCP,这些缩写和概念让很多朋友都有了些许困惑,本文将通过通俗易懂的语言,为你系统梳理AI领域的核心术语,帮助你快速建立AI领域各类专业名词的认知。
![]()
第一章:基础概念-AI的基本理解
1.1 人工智能(AI)
人工智能(Artificial Intelligence,简称AI)是让计算机模拟、延伸和扩展人类智能的技术。简单来说,就是让机器能够像人一样「思考」和「学习」。从早期的棋类对弈程序到如今的ChatGPT,都是人工智能的体现。
1.2 机器学习(ML)
机器学习(Machine Learning,简称ML)是AI的核心分支,指计算机系统从数据中自动学习和改进的技术。就像孩子通过观察学习认识动物一样,机器学习让计算机通过分析大量数据来发现规律、做出预测,而无需人类逐一编写规则。
1.3 深度学习(DL)
深度学习(Deep Learning,简称DL)是机器学习的一个进阶领域,使用多层神经网络来模拟人脑处理信息的方式。深度学习在图像识别、语音识别等领域取得了突破性进展,是现代AI技术的重要支柱。
1.4 神经网络(NN)
神经网络(Neural Network,简称NN)是受人脑启发的数学模型,由大量「神经元」节点通过权重连接组成。想象一个由成千上万个小灯泡组成的网络,每个灯泡的亮暗程度代表某种特征,综合起来就能识别图像或理解语言。
1.5 大语言模型(LLM)
大语言模型(Large Language Model,简称LLM)是具有庞大参数量的深度学习模型,能够理解和生成人类语言。GPT、Claude、Llama等都是典型的大语言模型。参数越多,模型通常越「聪明」,但也需要更多的计算资源。
1.6 通用人工智能(AGI)
通用人工智能(Artificial General Intelligence,简称AGI)是具有人类同等智能的AI系统,能够像人类一样在各种领域灵活思考和学习。目前的AI大多是「窄人工智能」,只在特定任务上表现出色,AGI仍是AI研究的终极目标。
第二章:模型架构-AI的大脑
2.1 Transformer架构
Transformer是当前AI领域最重要的架构之一,2017年由Google提出。它通过「注意力机制」让模型能够同时关注输入的所有部分,大幅提升了处理长文本的能力。GPT、BERT等著名模型都是基于Transformer构建的。
2.2 注意力机制(Attention)
注意力机制让AI学会「重点关注」。就像人类阅读时会重点关注关键词一样,这个机制让模型能够识别输入中最相关的信息,大幅提升翻译、对话等任务的效果。
2.3 卷积神经网络(CNN)
CNN是处理图像的核心架构,能够自动识别图像中的边缘、纹理、形状等特征。从人脸识别到医学影像分析,CNN是计算机视觉的基础技术。
2.4 循环神经网络(RNN)
RNN专为处理序列数据设计,能够记忆之前的信息来理解上下文。RNN是自然语言处理和语音识别的重要基础。
2.5 长短期记忆网络(LSTM)
LSTM是RNN的升级版,解决了RNN难以记住长期信息的缺陷。它像人脑一样,有「长期记忆」和「短期记忆」区域,能更好地处理长文本和长时间序列。
2.6 生成对抗网络(GAN)
GAN通过两个神经网络相互「对抗」来学习:一个负责生成内容,一个负责判断真假。这种技术被广泛用于AI绘画、人脸合成等生成式任务。
2.7 扩散模型(Diffusion Model)
扩散模型是当前AI绘画的主流技术,通过逐步「去噪」的方式从随机噪声中生成清晰图像。Stable Diffusion、DALL-E等都是基于扩散模型。
第三章:训练技术-让AI学会技能
3.1 预训练(Pre-training)
预训练是在大规模通用数据上训练模型的过程,让模型学习语言的基本规律和世界知识。这就像学生的基础教育阶段,学的是通用知识和能力。
3.2 微调(Fine-tuning)
微调是在预训练基础上,用特定领域数据进一步训练模型。就像医学生完成基础教育后,还需要专科培训才能成为专业医生。
3.3 迁移学习(Transfer Learning)
迁移学习是把在一个领域学到的知识应用到另一个领域的技术。比如,会下棋的AI可以借鉴其中的策略思维来学习其他游戏。
3.4 人类反馈强化学习(RLHF)
RLHF是通过人类反馈来调整AI行为的技术。AI生成回答后,人类评估其好坏,AI据此学习如何产生更符合人类期望的输出。ChatGPT之所以「会聊天」,RLHF功不可没。
3.5 低秩适配(LoRA)
LoRA是一种高效的模型微调技术,通过只更新少量参数来实现定制化,大大降低了微调的计算成本。就像给一台大机器更换关键零件,而不是整台机器重建。
第四章:应用领域-AI的使用场景
4.1 自然语言处理(NLP)
NLP是让计算机理解、生成和处理人类语言的技术。机器翻译、智能客服、情感分析等都是NLP的应用。
4.2 计算机视觉(CV)
计算机视觉是让计算机「看懂」图像和视频的技术。人脸识别、自动驾驶、医学影像诊断等都依赖于CV技术。
4.3 光学字符识别(OCR)
OCR能够将图片中的文字转换为可编辑的文本。文档扫描、车牌识别、名片整理等都靠OCR技术实现。
4.4 自动语音识别(ASR)
ASR将语音转换为文字,是智能音箱、语音助手、会议记录等应用的基础技术。
4.5 语音合成(TTS)
TTS将文本转换为自然语音,让机器能够「说话」。导航播报、有声书、虚拟主播等都依赖TTS技术。
第五章:智能体配置-Skills与工作流
5.1 什么是AI智能体(Agent)?
AI智能体是能够自主感知环境、做出决策并执行动作的智能系统。与简单的问答机器人不同,智能体具备规划、记忆、工具使用等能力,可以完成复杂的多步骤任务。
5.2 Skills(技能)详解
Skills是AI智能体平台(如Coze扣子)中的核心概念,指智能体具备的各种功能配置。良好的Skills配置就像给智能体装备各种工具,让它能够完成特定任务。Skills通常包括:
插件(Plugin):智能体的「工具箱」,提供天气查询、网页搜索、文档处理等扩展功能
工作流(Workflow):将多个步骤组合成自动化流程,实现复杂任务的编排
知识库(Knowledge Base):存储专业知识,让AI能够回答专业领域的问题
记忆(Memory):让智能体记住用户偏好和对话历史
变量(Variables):存储和传递信息的数据容器
触发器(Trigger):设置定时任务或条件触发的自动化规则
5.3 插件(Plugin)是什么?
插件是智能体的能力扩展模块。一个插件可以包含一个或多个API功能。比如添加天气插件后,智能体就能查询各地天气;添加地图插件后,就能提供导航服务。Coze平台提供了700+官方插件,用户也可以自定义插件。
5.4 工作流(Workflow)是什么?
工作流是将复杂的业务流程可视化编排的功能。就像流水线上的各个环节有序配合,工作流让AI能够按步骤执行复杂任务。比如一个「小红书文案助手」的工作流可能是:获取热点链接→提取内容→分析结构→生成文案→优化润色。
5.5 知识库(Knowledge Base)是什么?
知识库是智能体的「私人图书馆」,存储企业或个人的专业文档。智能体回答问题时,会先从知识库中检索相关内容,确保回答的专业性和准确性。知识库+AI生成=RAG(检索增强生成),这是解决AI「一本正经胡说八道」问题的关键技术。
5.6 提示词工程(Prompt Engineering)
提示词是给AI的指令,好的提示词能让AI更准确地理解任务。设计提示词就像写岗位说明书,需要明确:角色定位(你是谁)、核心任务(做什么)、行为规范(怎么做)、输出格式(做成什么样)。
第六章:AI领域热门技术概念
6.1 RAG(检索增强生成)
RAG将信息检索与AI生成相结合。当用户提问时,AI先从知识库检索相关信息,再结合检索结果生成回答。这就像一个既有丰富知识储备,又善于查阅资料的助手。
6.2 检索增强生成核心技术:Embedding与向量数据库
Embedding将文字、图像等转换为「向量」——一种数学表示,让语义相似的内容在向量空间中距离相近。向量数据库则专门存储和检索这些向量,实现快速的相似性搜索。
6.3 模型上下文协议(MCP)
MCP是Anthropic于2024年推出的开放协议,被称为AI的「USB-C接口」。它标准化了AI与外部工具、数据的连接方式,让开发者只需开发一次,就能对接多种AI系统。
6.4 函数调用(Function Calling)
函数调用让AI能够执行实际操作,而不只是生成文字。AI可以调用预设的函数来完成查天气、发邮件、查数据库等任务,实现从「会说话」到「会办事」的跨越。
6.5 智能体协作协议(A2A)
A2A是让不同AI智能体之间能够相互协作通信的协议。就像不同公司的员工需要统一的工作语言一样,A2A让各种AI智能体能够协同工作。
6.6 智能体增强RAG(Agentic RAG)
Agentic RAG将智能体能力融入RAG系统,让检索过程更加智能。AI能够自主规划检索策略、判断是否需要补充信息、对结果进行反思验证。
第七章:大模型的核心参数
7.1 Token(词元)
Token是AI处理文本的基本单位。英文中约4个字符=1个Token,中文约1-2个汉字=1个Token。模型的输入输出都按Token计费。理解Token有助于估算使用成本。
7.2 上下文窗口(Context Window)
上下文窗口是模型一次能处理的最大Token数量,决定了AI能理解的「记忆范围」。GPT-4 Turbo支持128K tokens,可以一次读完一整本书。
7.3 温度(Temperature)
温度参数控制AI输出的随机性。低温度(0.2左右)输出更稳定一致,适合需要准确性的任务;高温度(0.8左右)输出更有创意,适合需要想象力的任务。
7.4 幻觉(Hallucination)
幻觉是指AI生成看似合理但实际错误的内容。这是大模型的主要缺陷,可能误导用户。解决幻觉的方法包括RAG检索、微调、降低温度、使用思维链提示等。
7.5 思维链(Chain of Thought,CoT)
CoT是一种提示技术,让AI在回答前先展示推理步骤。这不仅有助于复杂问题的解答,也让用户能够理解AI的思考过程。
第八章:AI的评估与基准
8.1 MMLU-综合知识测试
MMLU涵盖57个学科领域的综合性测试,是评估大模型知识水平的重要基准。分数越高,说明模型的知识储备越丰富。
8.2 HellaSwag-常识推理
HellaSwag测试AI的常识推理能力,要求模型选择最合理的句子结尾。这类测试能反映模型的日常思维能力。
8.3 HumanEval-代码能力
HumanEval包含164道编程题,是评估AI代码生成能力的权威基准。
8.4 GSM8K-数学推理
GSM8K收录小学数学题,测试AI的多步骤数学推理能力。
8.5 基准测试(Benchmark)
基准测试是用标准化数据集评估AI性能的方法。就像考试有标准试卷一样,AI的「期末考试」就是各种基准测试。
第九章:开发工具与平台
9.1 TensorFlow与PyTorch
TensorFlow(Google开发)和PyTorch(Meta开发)是两个最流行的深度学习框架,提供构建和训练AI模型的工具。PyTorch因灵活易用在学术界更受欢迎,TensorFlow在工业部署中应用广泛。
9.2 Hugging Face
Hugging Face是全球最大的AI开源社区,提供数千个预训练模型和丰富的工具库。其Transformers库是NLP领域最流行的工具。
9.3 LangChain
LangChain是构建LLM应用的开发框架,提供模块化组件来连接大模型与外部工具、数据。相当于AI应用的「乐高积木」。
9.4 vLLM/Ollama/LM Studio
这些是大模型推理部署工具。vLLM专注于高吞吐量服务,Ollama支持本地简易部署,LM Studio提供桌面端LLM运行工具。
9.5 Coze扣子
Coze是字节跳动推出的智能体开发平台,支持零代码构建AI智能体。提供插件、工作流、知识库等丰富功能,让非技术人员也能快速搭建AI应用。
第十章:主流AI产品一览
10.1 GPT系列(OpenAI)
GPT是OpenAI开发的生成式预训练模型,GPT-4是其最新版本。ChatGPT就是基于GPT的对话产品。
10.2 Claude(Anthropic)
Claude由AI安全公司Anthropic开发,以安全和道德著称,采用「宪法式AI」训练方法。
10.3 Gemini(Google)
Gemini是Google的多模态大模型,能够处理文本、图像、音频、视频等多种类型数据。
10.4 Llama(Meta)
Llama是Meta开发的开源大模型,推动了开源AI生态的发展,其最新版本Llama 3已开源可商用。
10.5 Stable Diffusion
Stable Diffusion是开源的AI图像生成模型,可以在消费级GPU上运行,降低了AI绘画的门槛。
10.6 Midjourney/DALL-E/Imagen
这些是各公司推出的AI图像生成产品,各具特色:Midjourney以艺术风格见长,DALL-E由OpenAI推出,Imagen来自Google。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.