通用人工智能(Artificial General Intelligence, AGI)指具备与人类相当甚至超越人类的通用认知能力的人工智能——能够理解、学习、推理、规划并应对任意领域任务的智能。与只擅长单一任务的**狭义人工智能(ANI)**不同,AGI 追求的是“像人一样思考、什么都能做“。
| 层次 | 全称 | 能力 | 现状 |
| ANI | 狭义人工智能 | 只擅长特定任务(下棋、翻译、识图) | 已实现,遍地都是 |
| AGI | 通用人工智能 | 任何智力任务都能胜任 | 尚未完全实现,正在逼近 |
| ASI | 超级人工智能 | 全面超越人类智能 | 理论构想 |
| 维度 | ANI | AGI |
| 任务范围 | 单一/窄范围 | 任意任务 |
| 迁移能力 | 换任务需重新训练 | 举一反三,快速迁移 |
| 常识推理 | 基本没有 | 需要具备 |
| 自主学习 | 依赖标注数据 | 从少量样本/经验学习 |
| 代表 | AlphaGo、人脸识别、机器翻译 | ChatGPT、GPT-4 等(接近) |
能力
▲
│ AGI(目标)
│ ╱
│ ╱ 大语言模型(当前)
│ ╱
│╱────────── ANI(已实现)
└───────────────────────▶ 任务广度
| 能力 | 说明 | 相关技术 |
| 理解 | 理解自然语言、图像、语音等 | 大模型、多模态 |
| 推理 | 逻辑推理、数学计算、因果分析 | CoT(思维链)、推理模型 |
| 规划 | 分解目标、制定多步计划 | Agent、树搜索 |
| 学习 | 从数据、反馈、交互中改进 | 预训练、微调、RLHF |
| 记忆 | 长期存储与检索知识 | RAG、记忆系统 |
| 创造 | 生成新的内容与方案 | 生成式模型 |
| 交互 | 使用工具、与人协作 | Function Calling、Agent |
| 自我意识 | 理解自身状态与目标 | 尚属研究前沿 |
| 测试 | 说明 |
| 图灵测试 | 机器能否让人类无法分辨其与人类的对话(1950) |
| ARC(抽象推理语料库) | 测试流体智力:从少量示例归纳规律 |
| MMLU(大规模多任务语言理解) | 57 个学科的综合知识测试 |
| AGIEval | 面向人类的标准化考试(高考、LSAT、SAT 等) |
| GPQA(研究生级问答) | 博士级科学问题的推理能力 |
| 特性 | 说明 |
| 涌现能力 | 模型规模超过阈值后出现小模型没有的能力 |
| 上下文学习 | 不更新参数,仅凭提示词中的示例学会新任务 |
| 思维链 | 通过“逐步思考“提升推理能力 |
| 工具使用 | 调用代码、搜索、API 扩展能力边界 |
| 多模态 | 统一处理文本、图像、音频、视频 |
1950 图灵提出"机器能否思考"(图灵测试)
1956 达特茅斯会议:人工智能学科诞生
2012 AlexNet 在 ImageNet 夺冠,深度学习崛起
2017 Transformer 架构问世("Attention Is All You Need")
2018 GPT-1 发布,预训练+微调范式确立
2020 GPT-3 展示涌现能力(1750 亿参数)
2022 ChatGPT 发布,AGI 讨论进入大众视野
2023 GPT-4 通过多模态与复杂推理测试
2024 推理模型(o1、DeepSeek-R1)出现,强化学习+思维链爆发
2025 Agent 元年:AI 自主执行多步骤真实任务
大模型的能力随参数量、数据量、计算量的增大而可预测地提升:
模型能力 ∝ 参数规模 × 数据规模 × 算力
| 要素 | 含义 | 代价 |
| 参数 | 模型内部权重数量 | 训练成本指数增长 |
| 数据 | 训练语料质量与数量 | 高质量数据接近枯竭 |
| 算力 | GPU 训练计算量 | 电力与硬件成本 |
但 Scaling Law 并非无限有效:需要算法创新(如思维链、强化学习、稀疏模型)与架构创新(如 MoE、MLA)来持续突破瓶颈。
| 路线 | 思路 | 代表 | 现状 |
| 大语言模型 | 海量文本预测下一个词 | GPT 系列、DeepSeek | 最接近 AGI |
| 多模态大模型 | 统一文本/图像/音频/视频 | GPT-4o、Gemini | 快速推进 |
| 具身智能 | 智能体在物理世界中行动 | 人形机器人、自动驾驶 | 早期 |
| 世界模型 | 在内部建模真实世界的规律 | Sora、Genie | 探索阶段 |
| 神经符号 | 神经网络+符号逻辑结合 | 研究前沿 | 争议较大 |
| 强化学习 | 从交互与奖励中学习 | AlphaGo、DeepSeek-R1 | 重要组成 |
Agent 是 AGI 落地的重要形态:大模型作为“大脑“,通过工具与环境交互,自主完成任务。
用户目标
│
▼
┌──────────────┐ 规划 ┌──────────┐
│ 大模型(大脑) │ ───────> │ 任务分解 │
└──────┬───────┘ └────┬─────┘
│ 观察反馈 │ 调用
▼ ▼
┌──────────────┐ ┌──────────┐
│ 工具/环境 │ <───────── │ 搜索/代码/ │
│(浏览器、API) │ │ 终端/API │
└──────────────┘ └──────────┘
| 组件 | 说明 |
| 规划 | 把大目标拆成可执行的小步骤 |
| 记忆 | 上下文记忆 + 长期记忆(向量数据库) |
| 工具 | 调用搜索引擎、代码执行器、外部 API |
| 反思 | 根据结果修正计划(ReAct、Self-Refine) |
让模型“先思考再回答“,显著提升复杂推理能力:
普通提示: 27 × 13 = ?
直接回答: 351
思维链提示:
27 × 13 = 27 × (10 + 3)
= 270 + 81
= 351
AGI 的能力越强,其目标与人类不一致的风险就越大——这就是对齐问题(Alignment Problem):如何确保 AI 的目标、行为与人类价值观一致。
| 技术 | 说明 |
| RLHF(人类反馈强化学习) | 用人类偏好数据训练奖励模型,再微调模型 |
| DPO(直接偏好优化) | 无需奖励模型,直接优化偏好 |
| 红队测试 | 专门攻击模型找出漏洞与偏见 |
| 宪法式 AI | 用一组原则约束模型行为 |
| 可解释性 | 理解模型内部表征(稀疏自编码器等) |
| 风险 | 说明 |
| 幻觉 | 一本正经地编造错误事实 |
| 偏见 | 训练数据中的歧视性观点 |
| 越狱 | 提示词攻击绕过安全限制 |
| 滥用 | 深度伪造、自动化攻击、虚假信息 |
| 失控 | 能力超过人类控制范围(长期风险) |
| 影响 | 说明 |
| 替代 | 重复性、标准化工作被自动化 |
| 增强 | 人机协作,提升生产力 |
| 新职业 | 提示词工程、AI 训练师、模型治理 |
| 财富集中 | 算力与数据集中可能加剧不平等 |
AGI 可以加速科学研究:蛋白质结构预测(AlphaFold)、新材料发现、药物研发、数学证明(AlphaProof)——“AI 科学家“正在成为现实。
| 举措 | 地区/组织 |
| 《人工智能法案》 | 欧盟(按风险分级监管) |
| 《生成式人工智能服务管理暂行办法》 | 中国 |
| AI 安全峰会 | 英国、韩国等(国际协调) |
| OpenAI/Anthropic 安全承诺 | 前沿实验室自律 |
| 观点 | 代表人物/机构 | 预测 |
| 乐观派 | Sam Altman(OpenAI) | AGI 可能在未来几年到十年内出现 |
| 谨慎派 | Geoffrey Hinton、Yoshua Bengio | 安全风险巨大,需暂停前沿研发 |
| 怀疑派 | Gary Marcus 等 | 当前大模型只是“聪明的鹦鹉“,非真 AGI |
| 工程派 | Dario Amodei(Anthropic) | 强大 AI 十年内可达,规模是关键 |
无论时间线如何,**从“能聊天“到“能干活“再到“能自主决策“**的每一步,都伴随工程与伦理的双重挑战。
| 优势 | 说明 |
| 性能 | 接近 C/C++,适合推理引擎与训练基础设施 |
| 内存安全 | 无 GC、无悬垂指针,适合高并发推理服务 |
| 部署 | 单二进制分发,云原生友好(见第 63 章) |
/*
[dependencies]
candle-core = "0.9"
*/
// 用 candle 加载模型做推理的示意(简化)
use candle_core::{Device, Tensor};
fn main() -> Result<(), Box<dyn std::error::Error>> {
let device = Device::Cpu;
// 创建 2×3 矩阵并计算 softmax
let a = Tensor::randn(0f32, 1.0, (2, 3), &device)?;
let b = a.softmax(1)?;
println!("{b:?}");
Ok(())
}
| 知识点 | 要点 |
| 智能层次 | ANI(已实现)→ AGI(正在逼近)→ ASI(构想) |
| 核心能力 | 理解、推理、规划、学习、记忆、创造、交互 |
| 大模型路线 | 涌现能力、思维链、多模态、工具使用 |
| 技术路线 | 大模型、具身智能、世界模型、神经符号 |
| Agent | 规划 + 记忆 + 工具 + 反思 |
| 对齐与安全 | RLHF、红队测试、幻觉、偏见、越狱 |
| 影响 | 就业、科学加速、监管治理 |
| Rust 生态 | candle、burn、ort、tokenizers |
- 思维链实验:给一个开源模型(如 DeepSeek、Qwen)出同一道数学题,分别用“直接回答“和“逐步思考“提示,对比准确率。
- Agent 设计:用 Function Calling 实现一个“查天气并安排行程“的 Agent,画出规划-调用-反馈的流程图。
- 幻觉检测:让大模型回答 10 个事实性问题,逐个验证答案真实性,总结幻觉出现的规律。
- 越狱与防御:尝试构造 3 种越狱提示,分析其原理,再用系统提示词加固模型。
- 本地推理:用 llama.cpp 或 candle 在本地部署一个小模型,测量不同量化精度下的速度与质量。
- 伦理辩论:围绕“AGI 出现后谁该为它的行为负责“写一篇短文,从技术、法律、伦理三个角度论证。