数据
采集、清洗、标注、切分
PATH / 00
不要把 AI 看成一个黑盒产品。把它放回完整链路里:数据决定边界,训练塑造能力,推理把能力变成行为,Agent 再把行为接到世界。
采集、清洗、标注、切分
损失函数与梯度更新
让模型更像一个助手
token 逐步变成回答
调用工具,完成任务
INDEX / 09
从概念到工程,从训练到运行。每一章都可以独立阅读,也可以沿着编号一路走完。
HISTORY / 时间线
每次跃迁都不是凭空发生:新的表示方式、新的数据规模和新的计算基础,恰好在同一个时刻相遇。
“我们能否描述一个机器,使它表现出智能?”
— 达特茅斯会议提案,1955
AI 不只是算法史,也是人类不断更换问题表述的历史:从规则,到特征,再到表示和交互。
图灵测试、感知机与早期搜索奠定了问题的语言。专家系统随后把领域知识编码成 if / then。
RULES反向传播让多层网络重新获得生命。统计学习开始取代手工规则,数据成为新的知识载体。
FEATURES大规模数据、GPU 与更深的网络在视觉任务上形成合力,端到端学习进入主舞台。
REPRESENTATION自注意力让序列中的关系可以并行计算,语言模型从“预测下一个词”走向通用基础设施。
ATTENTION模型、工具、检索和多模态能力开始组合。真正的产品边界,从模型本身扩展到了系统设计。
SYSTEMSPRINCIPLES / 原理
神经网络不是在“理解”一段文字,而是在层层变换表示,最后对下一个 token 的分布做出估计。
输入是一串符号,输出是下一个符号的概率。中间的每一步,都是可观察、可测量的表示变化。
P(xt | x<t)模型在给定历史 token 的条件下,预测下一个 token。用带标签的样本学习一个映射:预测连续值是回归,预测类别是分类。
用局部感受野捕捉边缘、纹理与形状,再逐层组合成更高层的视觉特征。
局部 → 全局把前一步的隐藏状态带到下一步,适合描述序列,但长距离记忆会变得困难。
时间步 t → t + 1每个位置都可以查询其他位置,按相关性聚合信息;多头注意力让模型同时观察不同关系。
query × key → value智能体与环境交互,以奖励信号调整策略;重点从“像不像答案”变成“行动是否有效”。
探索 ↔ 利用STACK / 生态
同一个模型,经过不同的训练、编排、部署和评估工具,会成为完全不同的系统。先看分层,再选工具。
延迟、显存、数据合规、许可证,往往比“哪个框架最流行”更能决定选择。
框架不是信仰。训练和推理可以来自不同生态,接口清晰比全家桶更重要。
基准分数只是起点;用自己的数据、成本和失败案例验证,才算完成选型。
CLI / AGENT
当模型可以读取上下文、选择工具、检查结果,它就从“回答问题”变成了“推进任务”。能力来自循环,而不是一句神奇的 prompt。
$ agent run --task "检查本周发布"
› 正在拆解任务 ···
需要读取 changelog,并核对 CI 状态。› 调用工具 read_file
✓ CHANGELOG.md · 12 条变更› 调用工具 check_ci
! 1 个 job 仍在运行,等待 8s› 复核上下文 ···
✓ 已生成发布摘要,等待确认。
$
ADAPT / 微调
微调不是让模型凭空获得所有知识,而是用更少、更聚焦的数据,把输出格式、语气和任务策略推向目标。
准备“指令—回答”样本,让模型学习什么样的请求对应什么样的行为。
需要稳定输出格式、领域术语或操作步骤时。样本质量通常比样本数量更关键。
冻结基础模型,只训练低秩适配器;QLoRA 再通过量化降低显存门槛。
适配器小、迭代快,但任务边界和合并策略要记录清楚,避免能力互相干扰。
给同一个问题的多个回答排序,让模型更倾向于符合偏好的输出,而不只追求字面正确。
先写出可执行的偏好标准,再收集成对数据;模糊的偏好会被模型放大。
DATA / 数据集
模型能学到什么,首先取决于你让它反复看见什么。数据集的边界,就是模型能力的边界。
质量与规模不是二选一,但在预算有限时,优先找到能改变评估结果的数据。
TRAIN / 训练
每一步都在问:预测和目标差多远?梯度把答案传回网络,优化器再决定下一步往哪里走。
INFERENCE / 推理
用户只看见回答,但工程师要同时看见首 token 延迟、吞吐、显存、上下文长度与失败率。
把“快”拆成多个指标,才能知道优化到底改变了什么。
连续批处理、量化和 KV cache,是大模型服务常见的三组杠杆。
OPEN WEIGHTS / 开放权重
开放权重让部署、研究和微调更自由,但“能下载”不等于“能随意使用”。模型卡、许可证和数据来源都要一起看。
多语言与工具使用生态活跃,适合从本地实验到应用原型。
开放生态的重要基线,社区工具和微调资源丰富。
从轻量模型到混合专家架构,关注效率与部署灵活性。
面向研究与开发者的开放模型家族,提供不同规模选择。
覆盖通用、推理与代码场景,适合观察效率与能力的结合。
按任务、语言、许可证和参数规模筛选开放模型。
许可证、商用限制、训练数据声明、可接受使用政策和安全评估,都会随版本变化。这里的名称用于导航,不构成许可建议。
FIELD KIT / 继续探索
这份地图不是终点。选一个问题,用自己的数据跑通一条最小闭环,再回来补上缺失的概念。