微光实验室 · 博客归档

博客 第13页

记录技术探索与工程思考,共 655 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java243后端工程50微服务9AI Engineering86LLM33Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-274 Spark MLlib - 基础介绍 机器学习算法 剪枝 后剪枝 ID3 C4.5 CART

本文系统介绍了决策树的预剪枝与后剪枝原理,对比了ID3、C4.5和CART三种主流算法的核心差异,包括分裂标准、属性支持类型和剪枝方法。重点阐述了信息增益、信息增益率与基尼系数的计算原理,详细讲解了从树生成到剪枝的完整流程...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-273 Spark MLlib - 基础介绍 机器学习算法 决策树 分类原则 分类原理 基尼系数 熵

本文介绍了决策树的基本概念、分类原则和分类原理。决策树是一种非线性有监督分类模型,通过树形结构进行属性判断和分类。分类时应选择能将数据分类更纯粹的节点作为根节点,减少树高和训练次数。分类原理涉及熵、条件熵、信息增益等概念:

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-272 Spark MLlib - 基础介绍 机器学习算法 逻辑回归

本文介绍了逻辑回归的基本原理、应用场景和在Spark MLlib中的实现。逻辑回归是一种高效二分类算法,广泛应用于广告点击率、垃圾邮件识别等领域。文章详细讲解了逻辑回归的输入函数、Sigmoid激活函数和损失计算方法...

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-271 Spark MLlib - 基础介绍 机器学习算法 线性回归 场景 定义 损失 优化

线性回归(Linear Regression)是利用回归方程(函数)对一个或多个自变量和因变量之间关系进行建模的一种分析方式。特点:只有一个自变量的情况称为单变量回归,多于一个自变量情况的叫做多元回归。

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-268 实时数仓 - ODS层 将 Kafka 中的维度表写入 DIM

在 Kafka 中写入维度表(DIM)通常涉及将实时或批处理数据从 Kafka 主题读取,并根据数据流中的信息更新维度表。维度表存储与业务数据相关的维度信息,如客户、产品、地理位置等,用于支持 OLAP 查询。

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-269 实时数仓 - DIM DW ADS 层处理 Scala实现将数据写出HBase等

DW(Data WareHouse 数据仓库层),包含 DWD、DWS、DIM 层数据加工而成,主要完成数据架构与整合,建立一致性的维度,构建可复用的面向分析和统计的明细事实表,以及汇总公共粒度的指标。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

Spark MLlib 逻辑回归:Sigmoid、损失函数与糖尿病预测案例

逻辑回归是机器学习中的分类模型——一种高效的二分类算法,广泛应用于广告点击率预测、垃圾邮件识别等场景。本文介绍 Sigmoid 函数、损失函数和梯度下降优化。

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-266 实时数仓 - Canal 对接 Kafka 客户端测试

本文介绍了阿里巴巴开源的Canal工具,它通过解析MySQL的binlog实现数据库变更的数据捕获(CDC)。文章展示了如何将Canal与Kafka集成,实现数据库变更到消息队列的实时推送,包含INSERT、UPDATE...

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-267 实时数仓 - ODS Lambda架构 Kappa架构 核心思想

在互联网企业中,常见的 ODS 数据有业务日志数据(Log)和业务 DB 数据两类,对于业务 DB 数据来说,从 MySQL 等关系型数据库的业务数据进行采集,然后导入到 Hive 中,是进行数据仓库生产的重要环节。

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

Spark MLlib 线性回归:场景、损失函数与梯度下降

线性回归是一种利用回归方程对自变量和因变量之间关系进行建模的分析方法。本文介绍线性回归的应用场景、损失函数和梯度下降优化算法。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-265 实时数仓 - Canal 部署安装 启动服务 常见问题解决

Canal 是阿里巴巴开源的数据同步工具,用于 MySQL 数据库的增量日志解析和同步。它模拟 MySQL 从库协议,获取主库的 binlog 日志,从而实现实时数据捕获和传输,常用于数据迁移、缓存更新和搜索引擎同步等场景。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-263 实时数仓 - Canal 工作原理 工作流程 MySQL Binlog基本介绍

Canal 是一款用于 MySQL 数据库 binlog 增量订阅和消费的开源工具。它主要用于解决数据同步和分布式事务问题,支持将数据库变更同步到其他系统中,比如消息队列、大数据平台等。

系列教程 预计阅读时间: 5 分钟 大数据与数据工程

大数据-264 实时数仓 - Canal MySQL的binlog研究 存储目录 变动信息 配置MySQL

MySQL 的二进制日志(Binary Log,简称 binlog)是 MySQL 数据库中的一种日志文件类型,它记录了对数据库执行的所有更改操作(不包括 SELECT 和 SHOW 等查询操作)。它主要用于数据恢复、复制和审计等场景。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-262 实时数仓 - Canal 同步数据 介绍背景原理与优势 拉链表 实时统计

阿里巴巴 B2B 公司,由于业务的特性,卖家主要集中在国内,买家主要集中在国外,所以衍生出了杭州和美国异地机房的需求,从 2010 年开始,阿里系公司开始逐步的尝试基于数据库的日志解析,获取增量变更进行同步,由此衍生出了增量订阅、消费的业务。

系列教程 预计阅读时间: 7 分钟 Java 后端与微服务

深入浅出 Spring - AOP切面增强 核心概念 相关术语 Proxy配置

AOP 的本质:在不改变原有逻辑的情况下,增强横切的逻辑,横切逻辑代码往往是权限校验代码、日志代码、事务控制代码、性能监控代码。

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-261 实时数仓 - 业务数据库表结构 交易订单、订单产品、产品分类、商家店铺、地域组织表

实时数仓是一种数据仓库系统,区别于传统批处理数仓,它强调低延迟、高吞吐和高可用性。实时数仓能够处理流式数据或近实时的数据流,使企业能够及时监控关键指标并做出决策。

系列教程 预计阅读时间: 8 分钟 Java 后端与微服务

深入浅出 Spring - IoC容器体系 循环依赖 原型Bean 原型作用域 Lazy ObjectFactory

循环依赖是循环引用,也就是两个或者两个以上的 Bean 互相持有对方,最终形成环。

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-260 实时数仓 - 项目背景与需求 实时数仓架构 需求分析 技术选型 逻辑架构

数据实时处理能力成为企业提升竞争力的一大因素,最初阶段主要采用来一个需求,编写一个实时任务的方式来处理实时数据,随着需求的增多,计算任务也相对增多,并且不同任务的开发人员不同,导致开发风格差异化,该阶段的实时数据处理缺乏统一的规划...

系列教程 预计阅读时间: 4 分钟 Java 后端与微服务

深入浅出 Spring - IoC容器体系 BeanFactory过程分析 Bean Lazy-Init

本文深入分析 Spring IoC 容器体系,讲解 BeanFactory 过程分析以及 Bean 懒加载机制。

系列教程 预计阅读时间: 5 分钟 大数据与数据工程

大数据-259 离线数仓 - Griffin架构 修改配置 pom.xml sparkProperties 编译启动

Apache Griffin 是一个开源的数据质量管理框架,旨在帮助组织在大数据环境中监控和提高数据质量。用户可以自定义规则,使用 JSON 或其他标准格式来描述数据质量的各项要求,支持批处理和流处理数据。