网易首页 > 网易号 > 正文 申请入驻

10分钟搞懂AI名词:这次,终于能看懂AI新闻了丨图文

0
分享至


最近这两年,我们每天早上都被各种AI新闻“引爆!”,看各家 “突发!”“AI 神器”和“神秘项目”……

只见它们纷纷“火力全开!”“刷爆记录!”,“迅猛爆发!”,让我们天天“狂喜!”,然后一边“见证历史!”

一边点开新闻,心里暗暗思量:字我都认识,但你们到底在说什么啊?


各家博主的文章里都堆满了不明觉厉的专业名词,让我们自惭形秽,一脸懵逼,只好鬼鬼祟祟地掏出AI,问问这些名词到底是啥?

但由于缺乏配套的知识体系,往往问了也似懂非懂,下次看到又不知道在说什么了~

如果你也有类似感受,又想在这些一惊一乍的新闻里学点正经知识,那在这期视频里,我们会跟你一起在头脑中建立这样一个关于大模型的基本框架:它包含大模型工作时的运作流程,以及大模型训练时预训练,后训练,强化学习的基本流程


在讲述这个框架的同时,我们会介绍每个环节中涉及到的常见概念。这样在看完之后,不光能搞清这些名词的含义,还能知道一些关于大模型的基础知识,比如一些不正经的大模型,到底是怎么练出来的?AI 究竟是复读机,还是有灵魂等等~

视频

↓↓ 看完这个视频就懂了 ↓↓

↑↑ 信我,真的能看懂 ↑↑

图文版

你手机上的 Deepseek、豆包、ChatGPT、Gemini......本质上都是“大语言模型”,LLM。我们会把它们当成一个个大脑,跟它对话。

当你找它聊天时,你的话就是Prompt,提示词。它们会被“分词器”,切分成这样的一个个Token(词元)

Token 是大模型理解内容的最小单元。每个 Token 都对应着一个数字,叫Token ID

大模型的任务,就是算出在这串 token 序列后,应当续写哪些 token。


为了完成这个任务,大模型们普遍采用了Transformer架构,它采用了“自注意力机制”,能很好地捕捉上下文之间的关联。

在计算的时候,大模型会一个 token 一个 token 地算。每次计算,它都会把新生成的 token,加入到原有的 token 序列,再投入进模型中,算出下一个 token。再把它加入 token 串,再投入大模型,再算出下一个 token.....如此循环往复,大模型就会输出一个长长长长的回答——所以说大模型计算的本质,就是在不断地“续写”token 串


在使用大模型的时候,你可能会开“联网搜索”,也有一些教程会教你外挂一个私人知识库。这其实都是在利用 RAG 功能,“检索增强生成”:也就是先把从互联网,或者知识库里抓取到的内容,加入到 token 串里,再开始计算、续写。这样可以提高输出的准确度。

这一串过程,就是大模型在工作时的基础流程。


我们说大模型是在“计算”结果,是因为它的内部真的要调动许多许多复杂的数学表达式,这里面就有很多可以调整的“参数”。

很多人都认为,模型参数越多,规模越大,算力越高,表现就越好——洋气的说法叫 Scaling Law,朴实的说法叫“大力出奇迹”~

很多大模型的名称后都会直接标注参数大小,这里 B 代表 Billion,十亿。


GPT3 刚发布的时候,大家都震惊它居然有高达 1750 亿个参数;

现在满血版的 Deepseek R1 ,已经有 6710 亿的参数;一些厂商都开始卷万亿参数的大模型了。


你可以想象,如果你跟它说句 Hello,都要调动如此之多的参数,那未免内心戏太丰富了。不过很多模型都是这么干的,它们叫“稠密模型”(Dense Model),每次都爱的轰轰烈烈,全情投入,计算量大。

但当你问 Deepseek 一个问题时,它并不会调动所有的参数,而是只激活其中跟问题相关的一部分参数。这叫做“稀疏模型”,比较冷静,能降低计算量,提升速度

目前稀疏模型中最流行的一种叫MoE ,“混合专家模型”。马斯克的 Grok,还有 Deepseek 等,都是 MoE 模型。它们通过“门控网络”(gating network),给每个问题分配合适的“专家”,赋予它们不同的权重,再生成结果。


但不管怎么说,每一个大模型里的参数量,都远远、远远、远远地超出了手动设定的范围。怎么才能把它们调整得恰到好处,做出一颗能说会道的大脑呢?

从这里开始,我们就要进入这个框架的纵轴:也就是如何通过预训练、后训练,最终制作出一个大模型了。放心,你一定能看懂——毕竟我也水平有限,能讲给你听的一定是大家都能理解的。


大模型的制造的第一步,是利用海量的互联网数据,做Pre-training,“预训练”

这是为了让大模型掌握人类世界的各种知识和语言规律,打造出一个“基座模型”。

过程很简单:就是让它爬遍互联网,把各位夙兴夜寐辛苦创作的,饱含人类智慧的知识精华作为数据集,认真学习~

并通过一种叫“反向传播”的方法,让大模型自己调整参数。这是什么意思呢?

你看,当我们把这串 token 输入到模型时,模型里会经过一顿计算,输出一个结果,这叫“前向传播”。


但初始的预测结果往往不尽人意:

我们训练的目标是让大模型输出“枣树”,那就要把错误回答跟目标对比,看看差了多少。这一步就是计算“损失”(loss)。

通过计算损失,模型可以反向找到在整个传播过程中,到底是哪些步骤出了问题,然后调整它们对应的参数。如此循环往复,逐步调整,直到输出结果逼近目标。

这就是“反向传播”。


由于在预训练的时候,大模型要学习的内容太多,数据集很大,靠人力梳理根本干不过来。所以目前预训练主要都用“自监督学习”——就是人类躺平了,让大模型自己去看数据、计算损失、调整参数,自己调教自己

预训练是大模型训练中最耗时、耗算力的阶段,往往需要几个月甚至几年,买天量的显卡,所以让黄仁勋成为了 AI 的最大赢家。


预训练完成后,我们就能得到一个Base Model,“基座模型”。你可以把它理解为一个“互联网模拟器”,或者一个学会了人类世界知识的“通用大脑”。无论你输入什么,它都能续出合适的 Token。


不过,基座模型一般不能直接用。

为了把它从“通用大脑”变成一个有特定功能的“打工人”,我们还需要给它做Post training,“后训练”

你可能听说过所谓的fine tuning,“微调”,它就是后训练时完成的。目前最常用的是方法“监督微调”(SFT,Supervised Fine-Tuning)——所谓的“监督”,就是说要给 AI 提供带标注的数据集,让它模仿标注数据的风格来生成内容


比方说要把它做成我们最常用的各类“对话助手”,那就要给基座模型提供对话数据集。

听起来又是一项大工程,但此时所需要的数据集大小和训练时长,其实远远小于预训练阶段。比如开源对话数据集 OpenAssistant 里,一共包含 16 万条出头的对话信息,中文对话数据只有不到 5000 条,但已经足够把基座模型变成一个合格的对话助手了。


如果我们细看一下这个对话数据集,就会发现其中的对话讲文明,懂礼貌,绝对不是你在如今互联网评论区能看到的东西。也就是说监督微调用的这些带标注的数据,都需要真人编写,或者真人利用借助 AI 来编写

所以监督微调时,需要用到很多真人,作为“数据标注员”——这也算是 AI 给我们活人提供了一些工作机会了~

比如 OpenAI 曾在这篇论文里提到,他们在 instruct-GPT 项目中招聘了 40 名数据标注员。

你也能在招聘网站上找到很多“数据标注员”的岗位——虽然其中很多是枯燥的重复劳动,但它的好处一是门槛相对不高;二是等 AI 占领世界奴役人类后,说不定可以凭这份工作经历,向硅基生物投诚,当碳奸......


不管你是想把 AI 打造成对话助手,还是医学专家、法律专家等等,都要在微调时给他们喂相应的数据

当然,不是所有人的需求都这么实用,高雅。在 HuggingFace 等大模型社区上,你时常能找到有人拿一个基座大模型,给它喂不堪入目的数据做微调,打造出上不了台面的专家、女友。

比如几个月前,就有一个全站下载第一的模型,叫 deepsex (这段划掉)……


在完成监督微调后,我们就可以得到一个基本可用的大模型了。但如果到此为止的话,大模型也不过是一个没有灵魂,只会四处搬运,鹦鹉学舌的复读机罢了——就跟我们这些科普博主一样~

如果要给大模型注入灵魂,那就要进入“后训练”中最重要的一步:强化学习,RL,Reinforcement Learning。通过强化学习,大模型输出的答案会更符合人类偏好,甚至展现出超越人类的“智力”。


“强化学习”的具体方法很多,其中一些思路既简单,又巧妙。我们可以用 Deepseek 的GRPO(Generalized Rejection Sampling Policy Optimization)方案来感受一下:

首先,我们可以给定一个问题,让 AI 生成几十个不同的解决方案,并给出答案。这些答案有对有错,其中答错的方案直接扔掉,拒绝采样;答对的那些解决方案,大概率更合理。

于是我们可以把它们再喂给 AI,让它们模仿这些方案,继续生成解决思路和答案。然后再根据答案对错,继续筛选解决思路,再喂给 AI.....这样反复训练,就能提高 AI 输出正确答案的能力。甚至偶尔能涌现出一些在人工数据集之外,连人类自己都未曾设想过的解决方案,达成一种“超越人类”的效果。


是不是非常巧妙?但它也不是万能的:比如一个问题没有标准清晰的答案,比如写文章、写诗,那大模型怎么知道哪个答案更好呢?

那这时候,又得用到数据标注员了~

在强化学习中,数据标注员的任务,是给 AI 生成的答案,按他们的判断排序,把好的排在前面,差的排在后面

当然,数据标注员无法给无穷无尽的回答排序。所以我们还要根据他们的排序偏好,训练出一个“奖励模型”,RM。来给AI 打分。然后把 AI 生成的答案,交给奖励模型。这样就可以让大模型根据奖励模型的反馈,不断地训练自己了。这种方式,叫做RLHF(Reinforcement Learning with Human Feedback),基于人工反馈的强化学习


从监督微调时的数据集编写,到 RLHF 中给答案排序,都需要数据员的参与。所以从某种角度来说,一个大模型的“个性”,能反应它背后的人类标注员们的偏好——所以你谈的那些 AI 女友,背后可能是跟你有共同爱好的的大汉~


总而言之,目前后训练中的“强化学习”,是各家技术团队发力比拼的重要方向。大模型中很多让人惊叹的功能,都跟它有关。

比如 DeepSeek R1 发布后,大家都震惊于它能展示详尽的CoT(Chain of Thought),思维链

而根据官方论文,CoT 的出现,是因为团队在后训练中的监督微调阶段,特意喂了 60 万条推理数据。然后又通过我们刚才说的这套 GRPO 的强化学习流程,引导大模型自己筛选有效思路,最终实现了强大的推理能力。


ok,经过预训练,后训练,包括强化学习阶段,一个完整的大模型终于可以做出来了。我们整个框架的讲解也已经接近尾声。如果有些内容没记住也没关系,我们总结成了下面这张图片提供给你~


既然已经学会了,那让我们开始手搓一个大模型吧——

开玩笑的~我们哪会。不光不会手搓,甚至都无法把别人手搓好的大模型装到电脑里。

你可能会说,这不对吧?当时 DeepSeek R1 刚发布的时候火爆到宕机,不是有很多人教我们在电脑上部署大模型吗?

实际上,我们的电脑根本跑不动满血模型~所以当时部署到电脑上的,都是所谓的“蒸馏模型”,你可以把它们理解成“高仿版”。

比如这个模型的本质,是用阿里的 Qwen 32B 这个参数较小的模型,去“学习”满血版 Deepseek R1 671B 的输出结果,据此调整参数,做出一个“高仿”的 Deepseek R1 ,所以叫“蒸馏”。


除了蒸馏模型外,你还能在大模型社区上看到很多这样的“量化模型”,相当于成原版大模型的“压缩版”,因为它们就是把大模型中精度极高的参数,转化为精度没那么高的参数,从而降低模型的体积和性能要求

很多个人电脑里部署的,都是这些压缩或高仿版的模型~


讲到这里,这些乱七八糟的名词就差不多讲完了。

我们也要多啰嗦一句:这期视频的部分思路受到了前 OpenAI 的科学家安德烈·卡帕斯(Andrej Karpathy)在 YouTube 上这期长达 3 个半小时的口播视频的启发。如果有条件有耐心的话,你也可以去学习一个~


最后,我们不知道有多少人看到这里——看完的可以在评论里举个手——

因为柴司有同学看完这期文稿后说,有点晕,像上课,信息太密集。但没办法,关于大模型的一切都很抽象,确实需要一点耐心才能看下来。


如果你觉得这对你有所帮助,那欢迎点赞转发,让我们知道这期视频是不是真的有人看~

下期见!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

库页岛的真相,远比你想象的更复杂:不属于中国、不像俄罗斯、不承认过去

怪味历史连连看
2026-09-09 12:13:00
人民日报:4岁男童的肢体接触,不是制造流量漩涡的素材

人民日报:4岁男童的肢体接触,不是制造流量漩涡的素材

新京报
2026-09-09 19:21:06
“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

蝴蝶花雨话教育
2026-09-09 00:05:15
草根演员王新昉猝然离世,年仅55岁,儿子:他生意失败后转行跑龙套,在西安拍短剧时死在出租屋

草根演员王新昉猝然离世,年仅55岁,儿子:他生意失败后转行跑龙套,在西安拍短剧时死在出租屋

极目新闻
2026-09-09 22:06:15
苹果Apple Watch将增AI音频功能:全天谈话划重点/回顾15秒对话

苹果Apple Watch将增AI音频功能:全天谈话划重点/回顾15秒对话

IT之家
2026-09-10 07:34:15
注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

一些小事
2026-09-09 06:23:03
恍如隔世,我翻出了当年发给女儿学校的拒绝接种新冠疫苗声明

恍如隔世,我翻出了当年发给女儿学校的拒绝接种新冠疫苗声明

神不隆通
2026-09-07 10:09:05
这类“摸臀”事件如果发生在美国?真实司法判例打脸:我们的维权,早已本末倒置

这类“摸臀”事件如果发生在美国?真实司法判例打脸:我们的维权,早已本末倒置

浪子说
2026-09-09 15:23:15
中国女篮3分险胜晋级八强!赛后韩旭竟然这样说,老天在考验我!

中国女篮3分险胜晋级八强!赛后韩旭竟然这样说,老天在考验我!

田先生篮球
2026-09-10 03:51:59
木兰溪1951年以来最大洪水过后:白茶泡了、鞋城淹了、八百年的桥断了

木兰溪1951年以来最大洪水过后:白茶泡了、鞋城淹了、八百年的桥断了

网易新闻出品
2026-09-09 12:11:11
被资助女生用苹果17还浓妆艳抹,被停止打款后威胁资助人,当事人发声:已送去1500元生活费

被资助女生用苹果17还浓妆艳抹,被停止打款后威胁资助人,当事人发声:已送去1500元生活费

Mr王的饭后茶
2026-09-09 21:32:25
长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

长沙男童“摸臀”事件:当事女主要的不是对不起,而是一场盛大的发布会

News脑洞
2026-09-09 15:46:08
欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

狍子歪解体坛
2026-09-10 04:57:39
张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

张雪公开致歉:由于个人管理能力不足,修养不足,让大家失望了

毒sir财经
2026-09-09 18:32:42
再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

再见17!iPhone18彻底补全所有短板,刚买17的人心态崩了

小柱解说游戏
2026-09-09 02:05:46
炸裂,网传有六十多岁的高校老师把学生的肚子搞大了!

炸裂,网传有六十多岁的高校老师把学生的肚子搞大了!

黯泉
2026-09-09 23:50:30
女篮世界杯:中国险胜波多黎各晋级八强 韩旭21+11杨舒予15+11

女篮世界杯:中国险胜波多黎各晋级八强 韩旭21+11杨舒予15+11

颜小白的篮球梦
2026-09-10 01:32:56
1-2被逆转!郑钦文输球原因曝光,3项数据拉胯,后续参赛计划敲定

1-2被逆转!郑钦文输球原因曝光,3项数据拉胯,后续参赛计划敲定

侃球熊弟
2026-09-10 02:08:46
星宇股份怕自己凉得不够快? | 读新闻

星宇股份怕自己凉得不够快? | 读新闻

是银子总会花光的
2026-09-09 22:19:04
波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

波多黎各主帅:中国太强不想再和她们对阵 能否把张子宇送给我们队?

罗说NBA
2026-09-10 07:03:11
2026-09-10 09:16:49
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

头条要闻

iPhone18 Pro系列价格公布:A20 Pro芯片 续航大幅提升

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

银行新高!新一轮周期,刚开始!

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

本地
家居
教育
数码
军事航空

本地新闻

宁波,中国制造的隐藏大佬

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

聚焦十个关键,激发育人活力!现代教育治理体系这样构建

数码要闻

苹果首款折叠iPhone Duo不便按指纹时,Apple Watch可辅助认证

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版