模型量化:怎么把几十 GB 的大模型塞进普通笔记本
读完本文你会明白:大模型为什么那么占显存、量化如何用更少的数字存同样的模型、精度损失从哪来,以及自己本地跑模型前该怎么估算配置。…
回归、分类、聚类、集成学习等经典算法,以及模型评估的常用方法。
读完本文你会明白:大模型为什么那么占显存、量化如何用更少的数字存同样的模型、精度损失从哪来,以及自己本地跑模型前该怎么估算配置。…
人工智能很少给出绝对判断,更多是“有多大可能”。这种思维的数学基础是贝叶斯定理:用新证据更新原有判断。本文用一个疾病检测的反直觉例子,讲清先验、似然、…
只划分一次训练集和验证集,评估结果难免带运气成分。交叉验证通过把数据轮流切成多份、反复训练与验证,得到更稳定的估计。本文讲清 k 折交叉验证的做法、k 怎么…
为什么模型不是越复杂越好?偏差-方差分解给出了答案:预测误差可以拆成偏差、方差和不可约噪声三部分。本文用打靶的四种情形讲清偏差与方差的含义,说明它们与…
把事实存成实体—关系—实体的三元组,机器就能沿着关系链推理。本文讲清知识图谱的构建与使用方式、知识表示学习如何补全缺失三元组,以及它与大语言模型为何是…
混淆矩阵是所有分类指标的源头,一张几格表就能算出精确率、召回率等全部指标。本文用一个邮件过滤的具体例子,逐格解释真正例、假正例、真反例、假反例四个格子…
协同过滤不需要理解物品是什么,却能发现买帐篷的人常买防潮垫。本文讲清基于内容与协同过滤两条思路、召回排序重排的多阶段架构、冷启动与反馈指标的陷阱,以及…
一个模型准确率百分之九十九,为什么还是没用?因为在不平衡问题上,准确率会说谎。本文用疾病筛查和抓小偷两个例子,讲清准确率、精确率、召回率与F1值的定义和…
两个词只差一个字,含义却完全不同:参数是模型在训练中自己学出来的,超参数是人提前设定的。本文用做菜放盐与定火候的类比讲清这条分界,列举常见超参数,并说…
机器是怎么知道自己错了并改进的?答案藏在两个概念里:损失函数负责把错误量化成一个数,梯度下降负责沿着最陡的下坡方向一步步调整参数。本文用蒙眼下山和做题…
同样是从数据中学习,有没有标准答案会把方法分成几大类。本文用带答案的习题册、无答案的归类游戏、以及少量答案配大量未标注数据的混合模式,解释监督、无监督…
有的模型把练习题背得滚瓜烂熟,一上考场就崩;有的一看就没好好学,练习题都做不对。这两种状态就是过拟合与欠拟合。本文用备考类比讲清二者的成因、识别方法和…
为什么不能拿做过的题当期末试卷?本文用备考类比讲清训练集、验证集、测试集的三个角色:训练集用来学参数,验证集用来选模型和调超参数,测试集只在最后用一次…
机器不能直接看见一张照片或一段文字,它只处理数字。特征工程就是把原始素材转换成对任务有用的数字描述的过程。本文用相亲简历和挑选食材的类比,讲清特征构造…
在结构化数据的比赛和工业场景中,XGBoost 常年是被优先尝试的工具,它本质上是梯度提升树的高效实现。本文讲清它如何一棵树接一棵树地修正残差、为什么对缺失值和…
单个模型难免有偏见,把许多模型的意见综合起来往往更准。集成学习就是这套“集体决策”的思路。本文区分并列投票与逐个纠偏两种流派,并解释为什么模型之间必须…
一张表格有几百列,人眼看不出规律,模型也容易学歪。主成分分析能在尽量少丢信息的前提下把列数压下来。本文用“找最佳拍照角度”的类比讲清它的思路,以及降维…
没有人告诉算法正确答案,它也能把相似的东西归到一起——这就是聚类的魅力。K 均值是最常用的聚类方法之一,本文讲清它如何反复“选中心、归组、重算中心”,以…
要把两种点分开,可以画无数条线,哪一条才最好?支持向量机的答案是:选出让两边都留出最大空白的那条。本文用直观语言讲清间隔、支持向量与核方法,说明它为什…
如果你玩过“二十个问题猜东西”的游戏,就已经理解了决策树的思路。本文讲清决策树如何一步步提问把数据分开,以及随机森林如何用一堆各不相同的树投票,把单棵…