自动微分引擎(Autograd)全解析
[LATEXPAGE] 为什么需要自动微分 深度学习训练的核心循环可以概括为一句话:前向传播算损失,反向传播算梯度,优化器更新参数。其中「反向传播算梯度」这一步,正是由自动微分引擎(Autograd)完成的。 考虑一个典型的神经网络损失函数…
[LATEXPAGE] 为什么需要自动微分 深度学习训练的核心循环可以概括为一句话:前向传播算损失,反向传播算梯度,优化器更新参数。其中「反向传播算梯度」这一步,正是由自动微分引擎(Autograd)完成的。 考虑一个典型的神经网络损失函数…
本文基于 Andrej Karpathy 的 microgpt 博客和 Gist 代码 编写。microgpt 是一个 200 行、零依赖的纯 Python 文件,完整包含了训练和运行 GPT 所需的全部算法。 如果你用过 ChatGPT,…
大型语言模型(LLM)普遍过于庞大,需要昂贵的硬件才能运行,普通用户既难以负担,也无法保护隐私。而 1-bit AI(三元模型)正在改变这一局面——它能让近年顶级水平的 AI 模型直接运行在你的手机上。 什么是1-bit LLM? 传统 A…
在大语言模型(LLM)中,量化(Quantization) 是指将模型中的权重、激活值等数值从高精度浮点数(如 FP32、FP16、BF16)转换为低精度整数(如 INT8、INT4、INT2)的过程。简单说,就是用更少的比特数来表示原来的…
情感分析的定义与核心地位 情感分析(Sentiment Analysis),亦称为意见挖掘或倾向性分析,是人工智能领域中计算语言学的分支,属于自然语言处理(NLP)的核心内容。其核心定义为:通过自动化技术判定文本中观点持有者对特定话题的情感…
模型概述 RALM(Retrieval-Augmented Look-alike Model)是由腾讯公司于2019年提出并成功应用于微信“看一看”推荐场景的创新模型。该模型的核心目标在于解决传统推荐系统中普遍存在的长尾内容分发难题,即大量…
[LATEXPAGE] 推荐系统的优劣需要一套科学、多维度的指标体系来衡量。一套好的评价指标不仅能客观反映系统性能,更能指引产品优化和算法迭代的方向。本文旨在系统性地梳理推荐系统领域常见且重要的评测指标,结合其定义、计算方法、适用场景及优缺…
[LATEXPAGE] 机器学习中的损失函数用于衡量模型预测值与真实值之间的差异,是模型优化的关键。以下按任务类型分类介绍常见损失函数: 回归任务损失函数 均方误差 (Mean Squared Error, MSE / L2 Loss) 公…
[LATEXPAGE] 谱聚类简介 谱聚类(Spectral Clustering)是一种基于图论的聚类算法,它利用数据的相似性矩阵(拉普拉斯矩阵)的特征向量进行降维,然后在低维空间中使用传统聚类方法(如K-means)进行聚类。与K-me…
CLIQUE(CLustering In QUEst)是一种经典的子空间聚类算法,由IBM Almaden研究中心在1998年提出。它专门用于从高维数据中发现密度相似的簇,且这些簇可能仅存在于某些子空间(特征的子集)中,而非全维空间。 CL…