贝叶斯脑假说:大脑是一个概率推理机
你的大脑是一台概率推理机——先验信念加新证据等于后验信念。理解这个框架,就理解了为什么第一印象如此顽固,为什么'摆事实讲道理'经常无效。
AI 算法、产品思考与投资洞察。不定期更新。
你的大脑是一台概率推理机——先验信念加新证据等于后验信念。理解这个框架,就理解了为什么第一印象如此顽固,为什么'摆事实讲道理'经常无效。
你看到的不是世界本身,而是大脑对世界的最佳猜测。大脑不被动接收感官信息,而是持续生成预测,只处理预测误差。
衰老不是'物理磨损'的必然结果——它是自然选择力量随年龄递减的直接后果。你注定衰老,不是因为身体'坏了',而是因为进化'不在乎'你活过繁殖期。
进化不能从头设计——它只能改造已有的结构。创新不是凭空创造,而是旧功能的新组合。
自然选择不是只在一个层次上运作。基因、个体、群体三个层次同时运行,方向可能冲突。理解这个多层博弈,你才能理解合作、利他和道德的起源。
MoE 用稀疏激活让模型拥有万亿参数、单步只激活几百亿——每个 token 只路由到 Top-K 个专家子网络。Mixtral 8x7B、DeepSeek-MoE、传闻的 GPT-4 都采用这一范式。
诚实的信号必须昂贵。当质量不可直接观测时,浪费是传递真相的唯一方式。
DeepSeek 在 R1 论文里用 GRPO 砍掉 critic——用'组内相对奖励'代替价值网络估计优势。这一刀让 RLHF 显存降一半,且在推理任务上表现惊艳。
生命本质上是一个能量预算问题。你获得的能量是有限的,而生长、繁殖、维持、防御四个需求都在竞争同一份预算。
DPO 的洞察是:偏好数据里已经蕴含了最优策略,何必绕道训 RM?通过一个巧妙的数学变换,DPO 把 RLHF 的强化学习问题转化为标准交叉熵分类。
生物不是被动适应环境的机器——它们主动改造环境,而改造后的环境反过来成为新的选择压力。
RM 是 RLHF 的'评分官'——它把模糊的'人类偏好'翻译成可优化的标量信号。RM 一旦学歪,PPO 会把模型带向万劫不复的 reward hacking。
在竞争性协同进化系统中,你必须拼尽全力奔跑才能留在原地。停滞不是'保持现状'——停滞就是落后。
RLHF 是 ChatGPT 横空出世的'秘密武器'。它不是单一算法,而是一条三阶段流水线:SFT → RM → PPO。本篇把整条流水线讲透。
进化不奖励'善良',只奖励'稳定'。在任何合作系统中,作弊者永远不会消失——不是因为他们'坏',而是因为'作弊'在博弈论意义上是稳定的。
PPO 不是最强的方法,却成了 RLHF 的事实标准。它凭什么击败理论更优雅的 TRPO?答案藏在'工程实用主义'四个字里。
自然选择不是一个'理论'——它是一个算法。三个输入条件足以在零设计者参与的情况下,自动生成令人惊叹的复杂度。
RLHF 让 GPT 从'续写器'变成'助手',而理解 RLHF 之前必须先吃透 RL 的数学骨架。本篇从 MDP 讲起,搭建 RL 的数学基础。
相关不等于因果——这句话你听过无数次,但你未必理解它的物理基础。因果关系不是哲学概念,而是时空结构。
QLoRA 把基础模型量化到 4-bit,配合 LoRA 微调,让 65B 模型在单张 48G 显卡上就能微调。这是'组合拳'的胜利。
信息不是抽象的——它有物理实体,有重量,有温度。你删除1比特信息,宇宙的熵至少增加 k·ln2。
LoRA 用'低秩分解'这个线性代数 trick,把可训练参数压到原模型的 0.1%,效果却逼近全量微调。它是当前大模型微调的事实标准。
系统的性质不会平滑变化——在某个临界点,它会发生突跃式的'相变'。这种'突然'不是随机的,背后有精确的数学结构。
理解 BERT 为什么衰落,比单纯背诵它的原理更有价值。但衰落不等于死亡,BERT 在 Embedding 检索等场景仍是王者。
大量简单个体的互动会产生无法从个体行为预测的集体行为。'更多'不只是数量增加——'更多'意味着'不同'。
从 GPT-1 到 GPT-4,自回归路线如何从'BERT 的手下败将'逆袭成大模型事实标准?关键在训练范式与推理工程的协同演进。
宇宙中所有'不变量'都来自某种'不变性'。每一次你看到守恒律,都是在见证一个更深层的对称性。
预训练目标决定了模型在无监督语料上'自学会'什么能力,是模型能力边界的第一决定因素。MLM 学双向理解,CLM 学生成,Span Corruption 两者兼顾。
世界在底层是概率的,不是确定的。确定性只是一个宏观幻觉——就像你看报纸觉得字是实线,放大到墨点级别才发现全是离散的点。
Tokenization 是把原始字符串切分为模型可处理的最小单元的过程。三大主流算法共享'从字符出发、按统计合并'的核心思想,但在合并准则、语言无关性上差异显著。
没有'客观现实'——只有'某个参考系中观测到的现实'。永远先问'我在哪个参考系里?'
Layer Normalization 和残差连接是深度神经网络训练稳定性的两大基石。没有它们,GPT-4 的 120 层结构根本无法收敛。
宇宙是一个极致的'懒汉'——物理系统总是选择让'作用量'取极值的路径演化。这不是巧合,而是所有物理定律的统一底层逻辑。
Attention 机制本质上是一种'软寻址 + 加权聚合'操作。从 Bahdanau Attention 到 Multi-Head Attention,Attention 的进化史就是一部'让模型看得更全、更准、更快'的优化史。
能量不会消失,只会转移——但每一次转移,世界都会变得更混乱一点。这不是故障,这是宇宙操作系统最底层的 feature。
从业务约束出发,拆解如何用 Google OR-Tools 实现带时间窗口的车辆路径优化算法,解决真实物流场景中的排车问题。
从零搭建一套门店 AI 智能导购系统:后端用 Dify 编排工作流,前端用 React 构建流式对话 + 语音交互 + 虚拟角色的完整方案。
从网络效应、规模报酬递增、TAM扩张、留存飞轮、技术壁垒、单位经济六个维度,系统化拆解指数增长的底层驱动力。
从底层原理到工程实践,拆解 Transformer 的核心机制——Self-Attention 的数学本质、Multi-Head 的意义、位置编码的精妙设计。