从 1950 到今天,70 多年

人工智能发展历程

把 AI 这 70 多年踩过的关键节点按时间串一遍,再把那些听着吓人的核心技术翻译成人话。我自己学的时候总觉得时间线乱,所以干脆整理出来。

01发展时间线

按时间顺序列出 AI 历史上几个绕不开的节点。颜色对应不同阶段,方便你看冷暖交替。

萌芽与符号主义 专家系统与寒冬 机器学习复兴 深度学习与大模型
1950
图灵问:机器能思考吗?
图灵发了篇《计算机器与智能》,提出“模仿游戏”,也就是后来的图灵测试:机器要是能在文字对话里让人分不清它是人还是机器,就算它会“思考”。算是 AI 的哲学起点。
1956
达特茅斯会议:AI 这个名字有了
麦卡锡、明斯基一帮人在达特茅斯学院开了个会,第一次用“Artificial Intelligence”这个词。大家一般把这一年当作 AI 成为一门独立学科的开始。
1957
感知机(Perceptron)
罗森布拉特搞出感知机,一个最简单的人工神经元,能从数据里学到一点分类规则。今天所有神经网络都能追到它这儿。不过那会儿算力和理论都跟不上,它能做的事很有限。
1966
ELIZA:最早的聊天程序
魏泽鲍姆写了个能装心理医生的程序 ELIZA。它其实只会套模板,可不少人真信了机器有“理解力”。这件事说明一个问题:“听着像人”和“真懂”差得远。
1974–1980
第一次 AI 寒冬
靠人写规则的路子撞墙了:算力不够,现实又太复杂太模糊。钱和热情一起退潮,这就是所谓的“寒冬”。
1980s
专家系统火了一阵
把某个领域专家的知识写成“如果…就…”的规则,做成系统帮人决策,比如配计算机的 XCON。确实赚到过钱,毛病也明显:知识得一条条人手写,写不动也维护不起。
1986
反向传播:神经网络能训了
Rumelhart、Hinton 他们把反向传播算法推开来,解决了多层网络怎么训练的问题。神经网络从“玩具”变成“能用”,后来的深度学习基本是接着这条路走的。
1987–1993
第二次 AI 寒冬
专用硬件(Lisp 机)卖不动了,专家系统维护成本又高,AI 再次遇冷。不过研究没断,算法和数据都在 quietly 攒着。
1997
深蓝赢了卡斯帕罗夫
IBM 的“深蓝”在国际象棋上赢了世界冠军。它靠的是海量搜索加上人类棋谱规则,算是“暴力计算+领域知识”的胜利,跟今天那种自己学习的 AI 不是一回事。
2006
深度学习找到突破口
辛顿拿出一种能训好“很多层”神经网络的方法(深度信念网络)。算力、数据、算法这三样到这时候凑齐了,后面就快了。
2011
Watson 赢了《Jeopardy!》
IBM 的 Watson 在美国那档智力问答节目里赢了人类冠军,让人看到机器做自然语言问答能到什么程度。
2012
AlexNet:深度学习上桌了
ImageNet 图像识别比赛上,Krizhevsky、Hinton 他们的 AlexNet 用 GPU 训深度卷积网络,错误率甩开传统方法一大截。这一仗把深度学习推上了主流。
2014
GAN 和注意力机制同一年冒头
古德费洛提出 GAN,让机器学会“生成”以假乱真的图片;同一年注意力机制(Attention)也被提出来,给后面的 Transformer 铺了路。
2016
AlphaGo 赢了李世石
DeepMind 的 AlphaGo 把深度学习和强化学习凑一块儿,赢了围棋世界冠军。它不全靠人类棋谱,更多是自己跟自己下棋练出来的,整个棋坛都震了一下。
2017
Transformer:“注意力就是你所需要的一切”
谷歌那篇《Attention Is All You Need》提出 Transformer,用注意力机制高效处理序列。今天你用到的大语言模型,底子基本都是它。
2018–2020
预训练大模型登场:BERT、GPT
BERT、GPT-1/2/3 接连出现。思路很直接:先用海量文本“预训练”出一个懂语言的底座,再按需要微调。GPT-3 拿 1750 亿参数秀了一把“少样本”能力,挺让人意外的。
2022
ChatGPT 把 AI 推到大众面前
OpenAI 发了 ChatGPT,把对话能力做成人人能用的产品,5 天破百万用户。同年 Stable Diffusion、DALL·E 让 AI 画图也走进普通人视野。
2023–2024
多模态,还有会干活的 Agent
GPT-4 能同时处理图文,Sora 能生成视频,开源模型(LLaMA 那一批)也一下子冒出来一大堆。AI 开始从“聊天”往“能调工具、自己完成任务的 Agent”那边走。
2025–
推理模型,开始落地
o1、DeepSeek-R1 这类“推理模型”学会了回答前先多想几步,数学、编程这种硬题上进步很明显。AI 也越来越深地嵌进各种工作流和日常工具里。

02四个时代,一句话看懂

把上面的时间线压一压,AI 大致走过四个阶段。每个阶段要解决的“主要矛盾”不一样。

① 符号主义时代

把知识写成规则,让机器按规则推理。逻辑上很美,可惜不会自己学。

② 专家系统时代

把专家经验装进系统卖钱,但知识靠人写、维护贵,最后撞上寒冬。

③ 机器学习时代

不写死规则了,让机器从数据里自己归纳。数据越多,越靠谱。

④ 深度学习/大模型时代

深层神经网络加上海量数据和大算力,能力是直接“涌现”出来的。

03关键核心技术(人话版)

这些词经常被一起提,听着唬人。其实它们都在回答同一个问题:机器到底怎么“学”、怎么“想”?我尽量用大白话讲,每张卡片配一句生活里的类比帮着理解。

🧩

符号主义 / 专家系统

早期 AI 的脑子怎么搭

把知识写成“如果 A 且 B,则 C”这种规则,机器照着推导。好处是能讲清楚为什么,坏处是现实太复杂,规则永远写不全、也写不准。

说人话:像一本写满步骤的说明书,照着做没问题,可一旦遇上说明书没写的情况就抓瞎。
📊

机器学习(ML)

让数据代替规则

不手写规则了,给机器一堆例子,让它自己找输入到输出的规律。核心就一句:从经验里改自己。

打个比方:不教小孩“猫有尖耳朵”,而是塞给他一千张猫的照片,他自己总结出“这玩意儿大概就是猫”。
🕸️

神经网络 & 深度学习

学着大脑的连接方式

一堆简单的“神经元”分层连起来。每一层把输入稍微变一下,叠很多层之后就能学到很复杂的特征。层数一多,就叫“深度”学习。

想象一下:一条流水线,第一站看“有没有边”,往后逐级看出“是眼睛、是脸”,最后认出“这是个人”。
🔁

反向传播

神经网络怎么纠错

训练时先让网络猜一次,算出“错多少”,再把误差从输出层一路传回去,微调每一层的参数,让下次猜得更准。

就像考完试:老师从最后一题往前讲,你一道道修正思路,下次少错点。
🖼️

卷积神经网络(CNN)

看图的行家

用一个小窗口在图上滑着扫描,专门抓边缘、纹理、形状这些局部特征,干图像分类识别特别在行。AlexNet 就是靠它打出名气的。

类比一下:拿放大镜一块块看画,先认线条,再拼出鼻子眼睛,最后知道画的是谁。
🔄

循环网络 & LSTM

处理有先后的序列

普通网络记不住“上一刻”,RNN 让信息能从上一步传到下一步,适合语言、语音这种有顺序的数据。LSTM 是它的升级版,能记住更长的上下文。

通俗讲:读一句话时,你脑子里还记着前面说过啥,才懂后面那个“他”指的是谁。
🎭

生成对抗网络(GAN)

一个造假,一个打假

两个网络互掐:生成器负责造假图,判别器负责识破。越掐生成器越厉害,最后能造得以假乱真。

说人话:假币制造者和警察天天过招,假钞就越做越像真的。
🎯

注意力机制 / Transformer

大模型的地基

处理一句话时,让每个词都能直接“看”到别的词,不用一步步传,谁跟谁相关就多给点权重。Transformer 全靠注意力搭起来,能大规模并行训练,效率很高。

举个例子:读“猫坐在垫子上,它很乖”,你一眼就锁定“它=猫”,不用从头挨个回想。
💬

大语言模型(LLM)

预训练 + 提示

先拿几乎整个互联网的文本“预训练”,学会语言规律和一堆世界知识;再用指令微调、人类反馈(RLHF)把它对齐到人的意图。你给个提示,它接着往下写。

好比:先让一个人读遍图书馆,再教他“好好说话”,之后你问一句,他能接一大段。
🏆

强化学习(RL)

在试错里拿高分

机器在环境里行动,做对给奖励、做错给惩罚,自己摸索出最优策略。AlphaGo 用它,让大模型更“对齐”的 RLHF 也用它。

就像训狗:坐下就给零食,久而久之它就懂了“坐下=好事”。
🌈

多模态

图文音视频打通

让一个模型同时理解和生成文字、图片、声音、视频,把不同“感官”塞进同一个模型。GPT-4、Sora 都算。

说人话:一个人既能看书、又能看图、还能听懂你说话,然后把这些一起理解。
🤖

智能体(Agent)

会自己干活的 AI

不光聊天,还能拆步骤、调工具(搜索、写代码、发邮件)、看结果再调整,直到把一件复杂事办完。这是眼下最热的方向之一。

区别在这:从“你问一句它答一句”,变成“你给个目标,它自己拆开、动手做完”。