博客

AI 算法、产品思考与投资洞察。不定期更新。

第一性原理认知基座
第一性原理贝叶斯认知科学概率推理先验信念

贝叶斯脑假说:大脑是一个概率推理机

你的大脑是一台概率推理机——先验信念加新证据等于后验信念。理解这个框架,就理解了为什么第一印象如此顽固,为什么'摆事实讲道理'经常无效。

第一性原理认知基座
第一性原理认知科学预测编码大脑感知

预测编码理论:大脑不是记录现实,而是在预测现实

你看到的不是世界本身,而是大脑对世界的最佳猜测。大脑不被动接收感官信息,而是持续生成预测,只处理预测误差。

第一性原理认知基座
第一性原理进化论衰老寿命自然选择

寿命与衰老:从进化角度看为什么我们会死

衰老不是'物理磨损'的必然结果——它是自然选择力量随年龄递减的直接后果。你注定衰老,不是因为身体'坏了',而是因为进化'不在乎'你活过繁殖期。

第一性原理认知基座
第一性原理进化论预适应创新扩展适应

预适应:进化不是工程师,是修补匠

进化不能从头设计——它只能改造已有的结构。创新不是凭空创造,而是旧功能的新组合。

第一性原理认知基座
第一性原理进化论多层次选择合作群体选择

多层次选择:基因、个体、群体,选择到底发生在哪个层次

自然选择不是只在一个层次上运作。基因、个体、群体三个层次同时运行,方向可能冲突。理解这个多层博弈,你才能理解合作、利他和道德的起源。

LLM 深入简述
MoE稀疏激活大模型条件计算LLM深入简述

Mixture of Experts (MoE):稀疏激活的专家模型

MoE 用稀疏激活让模型拥有万亿参数、单步只激活几百亿——每个 token 只路由到 Top-K 个专家子网络。Mixtral 8x7B、DeepSeek-MoE、传闻的 GPT-4 都采用这一范式。

第一性原理认知基座
第一性原理进化论信号理论博弈论信息不对称

信号理论与扎哈维障碍:为什么孔雀要长那么大的尾巴

诚实的信号必须昂贵。当质量不可直接观测时,浪费是传递真相的唯一方式。

LLM 深入简述
LLMGRPODeepSeekRLHFPPO推理

GRPO:Group Relative Policy Optimization 详解(DeepSeek 核心技术)

DeepSeek 在 R1 论文里用 GRPO 砍掉 critic——用'组内相对奖励'代替价值网络估计优势。这一刀让 RLHF 显存降一半,且在推理任务上表现惊艳。

第一性原理认知基座
第一性原理生物学能量预算r/K选择生命史策略

能量预算理论:一切生命行为都可以归结为能量分配

生命本质上是一个能量预算问题。你获得的能量是有限的,而生长、繁殖、维持、防御四个需求都在竞争同一份预算。

LLM 深入简述
LLMDPO对齐偏好优化RLHF

DPO:Direct Preference Optimization 的原理与优势

DPO 的洞察是:偏好数据里已经蕴含了最优策略,何必绕道训 RM?通过一个巧妙的数学变换,DPO 把 RLHF 的强化学习问题转化为标准交叉熵分类。

第一性原理认知基座
第一性原理进化论生态位适应反馈循环

生态位构建:你不是在适应环境,你是在创造环境

生物不是被动适应环境的机器——它们主动改造环境,而改造后的环境反过来成为新的选择压力。

LLM 深入简述
LLM奖励模型RLHFBradley-Terry对齐

Reward Model:如何训练一个好的奖励模型

RM 是 RLHF 的'评分官'——它把模糊的'人类偏好'翻译成可优化的标量信号。RM 一旦学歪,PPO 会把模型带向万劫不复的 reward hacking。

第一性原理认知基座
第一性原理进化论红皇后效应竞争协同进化

红皇后效应:不奔跑就是在倒退

在竞争性协同进化系统中,你必须拼尽全力奔跑才能留在原地。停滞不是'保持现状'——停滞就是落后。

LLM 深入简述
LLMRLHFSFT奖励模型PPO对齐

RLHF:人类反馈强化学习的完整流程

RLHF 是 ChatGPT 横空出世的'秘密武器'。它不是单一算法,而是一条三阶段流水线:SFT → RM → PPO。本篇把整条流水线讲透。

第一性原理认知基座
第一性原理博弈论演化生物学ESS合作

演化博弈论:ESS进化稳定策略,为什么作弊者永远存在

进化不奖励'善良',只奖励'稳定'。在任何合作系统中,作弊者永远不会消失——不是因为他们'坏',而是因为'作弊'在博弈论意义上是稳定的。

LLM 深入简述
LLMPPO强化学习RLHF策略优化

PPO 算法:从 TRPO 到 PPO,为什么 PPO 成为主流

PPO 不是最强的方法,却成了 RLHF 的事实标准。它凭什么击败理论更优雅的 TRPO?答案藏在'工程实用主义'四个字里。

第一性原理认知基座
第一性原理进化论自然选择算法复杂性

自然选择的算法本质:变异+选择+遗传=复杂度自动生成器

自然选择不是一个'理论'——它是一个算法。三个输入条件足以在零设计者参与的情况下,自动生成令人惊叹的复杂度。

LLM 深入简述
LLM强化学习MDPRLHF贝尔曼方程

强化学习基础:MDP、Policy、Value Function

RLHF 让 GPT 从'续写器'变成'助手',而理解 RLHF 之前必须先吃透 RL 的数学骨架。本篇从 MDP 讲起,搭建 RL 的数学基础。

第一性原理认知基座
第一性原理因果推断统计学物理学Pearl

因果与关联:物理学视角下的因果推断

相关不等于因果——这句话你听过无数次,但你未必理解它的物理基础。因果关系不是哲学概念,而是时空结构。

LLM 深入简述
LLMQLoRA量化NF4LoRA微调

QLoRA:4-bit 量化的 NF4 与双重量化技术

QLoRA 把基础模型量化到 4-bit,配合 LoRA 微调,让 65B 模型在单张 48G 显卡上就能微调。这是'组合拳'的胜利。

第一性原理认知基座
第一性原理信息论热力学兰道尔原理计算物理

信息即物理:兰道尔原理与计算的热力学极限

信息不是抽象的——它有物理实体,有重量,有温度。你删除1比特信息,宇宙的熵至少增加 k·ln2。

LLM 深入简述
LLMLoRAPEFT微调低秩分解

LoRA 与参数高效微调:低秩分解的数学原理

LoRA 用'低秩分解'这个线性代数 trick,把可训练参数压到原模型的 0.1%,效果却逼近全量微调。它是当前大模型微调的事实标准。

第一性原理认知基座
第一性原理物理学相变临界现象复杂系统

相变与临界现象:量变引起质变的物理学解释

系统的性质不会平滑变化——在某个临界点,它会发生突跃式的'相变'。这种'突然'不是随机的,背后有精确的数学结构。

LLM 深入简述
LLMBERT双向编码器MLMEmbedding

BERT 与双向编码器:为什么现在大模型很少用双向编码器了

理解 BERT 为什么衰落,比单纯背诵它的原理更有价值。但衰落不等于死亡,BERT 在 Embedding 检索等场景仍是王者。

第一性原理认知基座
第一性原理复杂系统涌现复杂性科学

涌现现象:多即不同,复杂系统如何从简单规则中诞生

大量简单个体的互动会产生无法从个体行为预测的集体行为。'更多'不只是数量增加——'更多'意味着'不同'。

LLM 深入简述
LLMGPTCLM自回归RLHFScaling Laws

GPT 系列:自回归语言模型的训练与推理

从 GPT-1 到 GPT-4,自回归路线如何从'BERT 的手下败将'逆袭成大模型事实标准?关键在训练范式与推理工程的协同演进。

第一性原理认知基座
第一性原理物理学对称性诺特定理守恒律

对称性与守恒律:诺特定理如何解释一切守恒

宇宙中所有'不变量'都来自某种'不变性'。每一次你看到守恒律,都是在见证一个更深层的对称性。

LLM 深入简述
LLM预训练MLMCLMBERTGPTT5

预训练目标:MLM、CLM、Span Corruption 对比

预训练目标决定了模型在无监督语料上'自学会'什么能力,是模型能力边界的第一决定因素。MLM 学双向理解,CLM 学生成,Span Corruption 两者兼顾。

第一性原理认知基座
第一性原理量子力学不确定性概率思维

量子力学的不确定性:概率是世界的底层语法

世界在底层是概率的,不是确定的。确定性只是一个宏观幻觉——就像你看报纸觉得字是实线,放大到墨点级别才发现全是离散的点。

LLM 深入简述
LLMTokenizationBPEWordPieceSentencePiece

Tokenization:BPE、WordPiece、SentencePiece 的原理与差异

Tokenization 是把原始字符串切分为模型可处理的最小单元的过程。三大主流算法共享'从字符出发、按统计合并'的核心思想,但在合并准则、语言无关性上差异显著。

第一性原理认知基座
第一性原理物理学相对论认知范式

相对论思维:参考系决定了你看到的世界

没有'客观现实'——只有'某个参考系中观测到的现实'。永远先问'我在哪个参考系里?'

LLM 深入简述
LLMTransformerLayerNorm残差连接深度学习

Layer Normalization 与残差连接:为什么深度模型需要它们

Layer Normalization 和残差连接是深度神经网络训练稳定性的两大基石。没有它们,GPT-4 的 120 层结构根本无法收敛。

第一性原理认知基座
第一性原理物理学最小作用量变分法

最小作用量原理:大自然天生懒惰,这是效率的第一性原理

宇宙是一个极致的'懒汉'——物理系统总是选择让'作用量'取极值的路径演化。这不是巧合,而是所有物理定律的统一底层逻辑。

LLM 深入简述
LLMAttentionTransformer深度学习

Attention 机制的进化:从 Scaled Dot-Product 到 Multi-Head Attention

Attention 机制本质上是一种'软寻址 + 加权聚合'操作。从 Bahdanau Attention 到 Multi-Head Attention,Attention 的进化史就是一部'让模型看得更全、更准、更快'的优化史。

第一性原理认知基座
第一性原理热力学熵增物理学

能量守恒与熵增定律:为什么一切都在走向混乱

能量不会消失,只会转移——但每一次转移,世界都会变得更混乱一点。这不是故障,这是宇宙操作系统最底层的 feature。

实际案例
运筹优化CVRPTWOR-Tools物流整数规划

如何用运筹优化解决物流排车问题:CVRPTW 算法从理论到落地

从业务约束出发,拆解如何用 Google OR-Tools 实现带时间窗口的车辆路径优化算法,解决真实物流场景中的排车问题。

实际案例
DifyLLMRAG门店导购React

如何使用 Dify 快速构建 LLM 应用 API 并自定义前端来实现门店智能导购

从零搭建一套门店 AI 智能导购系统:后端用 Dify 编排工作流,前端用 React 构建流式对话 + 语音交互 + 虚拟角色的完整方案。

投资思考
指数增长投资分析第一性原理商业分析

指数增长的六维引擎:一套系统化识别指数增长公司的分析框架

从网络效应、规模报酬递增、TAM扩张、留存飞轮、技术壁垒、单位经济六个维度,系统化拆解指数增长的底层驱动力。

LLM 深入简述
TransformerSelf-AttentionLLM深度学习LLM深入简述

Transformer 架构:Self-Attention 与位置编码的数学本质

从底层原理到工程实践,拆解 Transformer 的核心机制——Self-Attention 的数学本质、Multi-Head 的意义、位置编码的精妙设计。