微光实验室 · 博客归档

博客 第27页

记录技术探索与工程思考,共 731 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java247后端工程50微服务9AI Engineering86LLM109Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
系列教程 预计阅读时间: 18 分钟 大数据与数据工程

大数据-203 scikit-learn 决策树剪枝参数:max_depth/min_samples_leaf 参数调优

场景:DecisionTreeClassifier 过拟合、树太大/内存飙升、样本不均衡需要可控剪枝与权重 结论:优先用 maxdepth + minsamplesleaf 做基线

系列教程 预计阅读时间: 14 分钟 大数据与数据工程

大数据-204 混淆矩阵到ROC:不平衡二分类评估指标全梳理 sklearn

混淆矩阵(TP、FP、FN、TN)建立统一口径,解释 Accuracy、Precision(查准率)、Recall(查全率/敏感度)、F1 Measure 的业务含义:Precision 对应"误伤多数类"的成本...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-79 Spark Standalone 模式:架构解析与性能调优

全面讲解 Spark Standalone 集群的四大核心组件、应用提交流程、SparkContext 内部架构,以及 Shuffle 演进历史和 RDD 优化策略。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-80 SparkSQL 入门:SQL 与分布式计算的融合

系统介绍 SparkSQL 的演进历史、核心抽象 DataFrame/Dataset、Catalyst 优化器原理,以及与 Hive/HDFS 多数据源集成的实战用法。

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-201 决策树从分裂到剪枝:信息增益/增益率、连续变量与CART要点

"分裂"到"剪枝"的完整链路,解释其为何通常采用贪心算法形成"局部最优",以及不同算法在分裂准则上的差异:ID3/C4.5偏信息增益(Information Gain),但信息增益会偏向取值多的特征,因此引入信息增益比/增益率(Gain R...

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-202 sklearn 决策树实战:criterion、Graphviz 可视化与剪枝防过拟合

DecisionTreeClassifier 在 loadwine 数据集完成从数据拆分、建模评估到决策树可视化的完整流程(2026版)。重点解释 criterion 的选择:gini(基尼不纯度)、entropy 与 logloss(信息...

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-199 决策树模型详解:节点结构、条件概率视角与香农熵计算

决策树模型(Decision Tree)面向分类任务系统梳理:树的三类节点(根节点/内部节点/叶节点)、从根到叶的递归分裂流程,以及"分而治之"的规则生成机制。理论层面给出决策树的条件概率分布视角:

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-200 决策树信息增益详解:信息熵、ID3 选特征与 Python 最佳切分实现

决策树信息增益(Information Gain)展开,先用信息熵(Entropy)解释不纯度,再说明为何在节点切分时要最大化父节点熵与子节点熵之差:在 Ent(D) 固定的前提下,最大化 Gain 等价于最小化分支不纯度的加权平均...

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-197 K折交叉验证实战:sklearn 看均值/方差,选更稳的 KNN 超参

训练/测试随机划分会导致评估指标不稳定,并给出工程化解法:K折交叉验证(K-Fold Cross Validation)。通过sklearn的crossvalscore在训练集内部做多次划分,输出每折得分数组...

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-198 KNN 必须先归一化:Min-Max 正确姿势、数据泄露陷阱与 sklearn 落地

scikit-learn机器学习训练流程中,KNN这类距离模型对"量纲不统一"极其敏感:欧式距离的平方和会让数值尺度更大的特征主导距离,从而显著拖垮分类效果。Min-Max归一化通过"减最小值再除以极差"把特征压缩到[0,1]...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-77 Spark RDD 容错机制:Checkpoint 原理与最佳实践

详解 Spark Checkpoint 的执行流程、与 persist/cache 的核心区别、分区器策略,以及在迭代算法和长依赖链场景下的最佳使用实践。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-78 Spark 广播变量:高效共享只读数据

详解 Spark 广播变量的工作原理、配置参数与最佳实践,以及利用广播实现 MapSideJoin 替代 shuffle join 的性能优化方案。

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-195 KNN/K近邻算法实战:欧氏距离+投票机制手写实现,含可视化与调参要点

KNN/K近邻算法(K-Nearest Neighbors, KNN):从欧氏距离计算、距离排序、TopK投票到函数封装,给出可复现的Python代码与matplotlib可视化。重点解释K值对模型偏差/方差的影响...

系列教程 预计阅读时间: 14 分钟 大数据与数据工程

大数据-196 scikit-learn KNN 实战:KNeighborsClassifier、kneighbors 最近邻与学习曲线选择

从统一 API(fit/predict/transform/score)到 kneighbors 找出测试样本的 K 个最近邻,再到用学习曲线/参数曲线选择 nneighbors(K 值)。重点说明:

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-193 Apache Tez 实战:Hive on Tez 安装配置、DAG原理与常见坑

Apache Tez(示例版本 Tez 0.9.x)如何在 Hadoop2/YARN 上作为执行引擎替代 MapReduce,为 Hive on Tez、Pig on Tez 提供 DAG(有向无环图)执行模型。

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-194 数据挖掘 从红酒分类到机器学习全景:监督/无监督/强化学习、特征空间与过拟合一次讲透

2025年仍最常用的机器学习概念框架:监督学习(分类/回归)、无监督学习(聚类/降维)、半监督学习与强化学习。重点解释输入空间、输出空间与特征空间的关系,以及过拟合/欠拟合在训练集与交叉验证集上的典型表现与治理思路

系列教程 预计阅读时间: 19 分钟 大数据与数据工程

大数据-191 Elasticsearch 集群规划与调优:节点角色、分片副本、写入与搜索优化清单

Master / Data / Coordinating 三类节点职责与生产落地的角色隔离策略,给出容量规划的推算抓手(JVM Heap 30–32GB 上限、冷热数据与磁盘/IO 约束、水平扩容路径),并将分片(shard)与副本(rep...

系列教程 预计阅读时间: 15 分钟 大数据与数据工程

大数据-192 DataX 3.0 架构与实战:Reader/Writer 插件模型、Job/TaskGroup 调度

DataX(DataX 3.0)是阿里体系广泛使用并开源的离线数据同步/数据集成工具,面向企业级异构数据源同步(MySQL、Oracle、SQLServer、PostgreSQL、HDFS、Hive、HBase、OTS、ODPS 等)。

系列教程 预计阅读时间: 11 分钟 大数据与数据工程

大数据-75 Spark Super WordCount:文本清洗 + 词频统计 + MySQL 持久化

实现一个完整的生产级词频统计流水线:小写转换、标点去除、停用词过滤、词频计数,最终通过 foreachPartition 高效写入 MySQL,对比逐条插入与分区批量写入的性能差异。

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-76 Spark 序列化机制与 RDD 执行原理

深入讲解 Spark Driver-Executor 进程通信、Java/Kryo 序列化选型、闭包序列化问题排查,以及 RDD 依赖、Stage 划分和持久化存储级别。