数据

营销活动分析中的增量分析

增量分析(Incremental Analysis)是衡量营销活动或广告投放“真实增量效果”的核心方法,旨在回答一个关键问题:如果没有这次营销活动,用户的行为会发生怎样的变化?它通过量化广告带来的纯新增转化(即用户原本不会自然发生的转化行为…

数据 ·
2 0 1

基于目标编码的类别型特征分组

[LATEXPAGE] 什么是目标编码? 目标编码(Target Encoding),又称均值编码、似然编码,是一种将分类变量转换为数值特征的技术,通过利用目标变量的统计信息来捕捉类别与目标之间的关系。 核心思想 目标编码用目标变量的统计量…

数据 ·
0 0 620

FastAPI学习之后台任务

为什么需要后台任务? 场景痛点:同步处理耗时操作(如发送邮件、数据分析)导致请求阻塞,用户体验差。 核心价值:后台任务实现异步非阻塞,提升吞吐量和响应速度。 FastAPI 优势:原生支持异步、多种任务方案灵活选择。 后台任务的用途 异步执…

数据 ·
0 0 1

基于差异的决策树分箱

[LATEXPAGE] 在数据分析或算法模型搭建时,经常会遇到将连续变量转化为类别分箱的场景。用的分箱方法有等宽分箱、等频分箱、聚类分箱和基于决策树的分箱等。今天要分享的是基于组别间差异的决策树分箱方法。 代码实现 import panda…

数据 ·
0 0 547

数据处理之重采样(过采样与欠采样)

[LATEXPAGE] 重采样(Resampling)是处理数据不平衡问题的核心技术之一,通过调整训练数据中不同类别的样本比例,使模型更关注少数类。 重采样的两类核心方法 过采样(Oversampling) 目标:增加少数类样本数量,平衡类…

数据 ·
0 0 2

大语言模型的Temperature、Top-p、top_k

[LATEXPAGE] 在使用开源的大语言模型或者调用大语言模型API的时候会遇到temperature、top_p、top_k等参数,对于不了解的LLM的原理的人,可能一头雾水,不知道如何设置。 LLM的原理 LLM看似很神奇,但本质还是…

数据 ·
3 0 3

指标异常归因算法iDice

iDice简介 iDice(指标异常归因算法)是一种用于识别与新出现问题(Emerging Issues)相关的有效组合的自动化算法。它通过从海量属性组合中高效地识别出与新兴问题高度相关的有效组合,帮助技术支持工程师快速定位和解决问题。 新…

数据 ·
0 0 900

Pandas Dataframe数据美化输出

在 Pandas 中,DataFrame.head() 方法默认输出一个格式化的表格,这在 Jupyter Notebook 或终端中查看时通常已经比较可读。但是,如果你希望以更好的文本格式输出,尤其是在需要将输出嵌入到其他文档或日志中时,…

数据 ·
4 0 1

现代数据架构Open Data Lake (ODL)

OpenDataLake简介 OpenDataLake是一种数据存储和管理架构,旨在以一种开放、灵活和可扩展的方式处理大量的多结构化数据。数据湖的概念是将数据以原始格式存储,以便在需要时进行分析和处理。OpenDataLake的开放性通常指…

数据 ·
2 0 576

数据处理方法ETL与ELT的区别

ETL(Extract, Transform, Load)和ELT(Extract, Load, Transform)是两种常见的数据集成方法,它们在数据处理的顺序上存在显著差异。 ETL(提取、转换、加载) 过程:首先从各种数据源中提取数…

数据 ·
1 0 624