数据

LightGBM 二分类概率校准问题修复实践

构建 LightGBM 二分类模型,数据存在类别不平衡(正样本率 < 30%),模型排序能力正常(AUC 合理),但预测概率系统性偏高——预测均值远大于实际正样本率,整体偏差显著。 诊断方法:分箱校准统计 按固定步长(如 0.05)对…

数据 ·
0 0 103

变量分箱与自然分组实践总结

在数据分析与建模中,我们经常遇到两类变量处理难题: 连续变量(如距离、时长、金额、温度):取值范围连续,直接使用可能导致模型过拟合,且难以输出可解释的业务结论。例如"距离7km"不如"中途(15-30km)"直观。 高基数类别变量(如小时、…

数据 ·
0 0 94

长尾目标的 LightGBM 优化实践

背景:长尾分布的建模困境 什么是零膨胀长尾分布 在真实业务场景中,大量目标变量呈现零膨胀长尾分布(Zero-Inflated Long-Tail Distribution): 大量零值:目标变量中零值占比极高(如 40%~60%) 少量极端…

数据 ·
0 0 124

数据湖与数据仓库的对比

在当今数据驱动的商业环境中,企业面临着海量、多样且高速增长的数据挑战。为了从这些数据中提取价值,两种主流的存储与管理架构应运而生:数据湖与数据仓库。尽管它们都是用于存储和分析数据的系统,但其设计哲学、技术实现和应用场景存在根本性差异。 数据…

数据 ·
2 0 224

用户体验指标客户费力度(CES)

客户费力度(CES)是一个直接衡量客户在与企业互动过程中所付出努力程度的指标,其核心理念在于:客户体验越轻松,他们的满意度和忠诚度往往越高 。 CES 的核心概念与价值 CES 的核心是“减少客户的努力”,强调让客户以最直接、最不费力的方式…

数据 ·
0 0 252

正例-无标记学习PU Learning

什么是 PU Learning? PU Learning 的全称是 Positive-Unlabeled Learning,即正例-无标记学习。它是一种在半监督学习范畴内的特殊机器学习设定。 与传统的监督学习(数据有明确的“正例”和“负例”…

器→工具 ·
4 0 536

相似人群扩展Lookalike技术

Lookalike简介 Lookalike(相似人群扩展)是一项用于在庞大用户群中寻找与特定“种子用户”相似的新用户的技术。它广泛应用于广告、推荐系统等领域,其核心逻辑可以概括为以下几个步骤: 核心方法解析 Lookalike的实现方式多样…

数据 ·
3 0 788

出行/旅游场景下的用户细分

在当今竞争激烈的旅游市场中,将您的客户简单地归类为“商务旅客”或“休闲游客”已经远远不够了。这就像试图用一把钥匙打开所有的门——效果甚微。每一位旅行者都是独特的,他们的决策背后交织着复杂的需求、动机和行为模式。 那么,如何才能真正理解他们,…

数据 ·
0 0 204

开源因果推断库CausalML

因果推断核心概念 我们将通过一个贯穿始终的简单例子来讲解:评估一个广告(比如一封营销邮件)对用户购买行为的影响。 干预(Treatment): 发送营销邮件。 W = 1:用户被分配到处理组(计划发送邮件)。 W = 0:用户被分配到对照组…

数据 ·
1 0 544

机器学习在酒店聚合中的应用与实践

在线旅游平台通过整合多个供应商的酒店资源,为用户提供一站式比价服务。酒店聚合能力直接影响用户体验:一方面需要确保信息准确,避免"到店无单"的风险;另一方面要保证信息的实时性,帮助用户快速决策。 业务挑战分析 准确性挑战。不同供应商对同一酒店…

数据 ·
1 0 169