微光实验室 · 博客归档

博客 第31页

记录技术探索与工程思考,共 731 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java247后端工程50微服务9AI Engineering86LLM109Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-147 Java 访问 Apache Kudu:从建表到 CRUD(含 KuduSession 刷新模式与实战)

Java 客户端(kudu-client 1.4.0)连接 Apache Kudu 多 Master(示例端口 7051/7151/7251),完成建表、插入、查询、更新、删除全流程,并对 KuduSession 刷新模式(AUTOFLUS...

系列教程 预计阅读时间: 3 分钟 大数据与数据工程

大数据-144 Apache Kudu:实时写 + OLAP 的架构、性能与集成

Apache Kudu 在 2025 年的版本与生态集成:最新 Kudu 1.18.0(2025/07)上线,带来分段 LRU Block Cache 与基于 RocksDB 的元数据存储(实验特性),在保证 Raft 副本一致性的同时提升...

系列教程 预计阅读时间: 11 分钟 大数据与数据工程

大数据-145 Apache Kudu 架构与实战:RowSet、分区与 Raft 全面解析

Apache Kudu 的 Master/TabletServer 架构、RowSet(MemRowSet/DiskRowSet) 写读路径、MVCC、以及 Raft 共识 在副本与故障切换中的作用;

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-143 ClickHouse MergeTree 分区/TTL、物化视图、ALTER 与 system.* 实战

ClickHouse 初学与运维实战,基于真实集群(h121/h122/h123)演示从连接到建库建表的完整流程,系统讲解 MergeTree 的 ORDER BY/PRIMARY KEY/PARTITION BY/TTL 关键点;

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-57 Kafka Producer 消息发送流程与核心参数详解

深入解析 Kafka Producer 初始化、消息拦截、序列化、分区路由、缓冲批量发送、ACK 确认等完整发送链路,并给出关键参数的调优建议。

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-58 Kafka 序列化机制与分区策略:自定义实现详解

深入讲解 Kafka 消息序列化原理与分区路由策略,包含自定义 Serializer 和 Partitioner 的完整代码实现,帮助掌握消息精准路由与高效传输。

系列教程 预计阅读时间: 14 分钟 大数据与数据工程

大数据-141 ClickHouse 副本实战 | ReplicatedMergeTree + ZooKeeper 协调

ClickHouse 副本全链路:ZK/Keeper 准备、macros 宏配置、集群 ON CLUSTER 一致建表、写入去重与复制机制、system.* 视图健康检查、insertquorum 一致性、Distributed 跨分片查询

系列教程 预计阅读时间: 5 分钟 大数据与数据工程

大数据-142 ClickHouse分片×副本×Distributed 实战 | ReplicatedMergeTree + Distributed

ClickHouse 分片×副本×Distributed 架构:基于 ReplicatedMergeTree + Distributed,在 3 分片×2 副本 集群上用 ON CLUSTER 一键建表,启用 ClickHouse Keep...

系列教程 预计阅读时间: 15 分钟 大数据与数据工程

大数据-139 ClickHouse MergeTree 最佳实践:Replacing 去重、Summing 求和、分区设计与物化视图替代方案

场景:解决去重/更新与按键求和两类常见"准实时明细表"需求。 结论:ReplacingMergeTree 用于按排序键去重/按版本取最新

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-140 ClickHouse CollapsingMergeTree详解 外部数据源最小闭环HDFS/MySQL/Kafka

ClickHouse 外部数据源引擎的最小可行方案:ENGINE=HDFS、ENGINE=MySQL、ENGINE=Kafka 的 DDL 模板、关键参数与读写链路。示范 Kafka→Materialized View→MergeTree...

系列教程 预计阅读时间: 15 分钟 大数据与数据工程

大数据-137 ClickHouse MergeTree 实战指南|分区、稀疏索引与合并机制 | 存储结构 | 一级索引 | 跳数索引

ClickHouse MergeTree 的关键机制:批量写入形成 part、后台合并(Compact/Wide 两种 part 形态)、ORDER BY 即稀疏主索引、indexgranularity 标记密度与 primary.idx...

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-138 ClickHouse MergeTree 实战详解|分区裁剪 × 稀疏主键索引 × marks 标记 × 压缩

ClickHouse MergeTree 的存储与查询路径:列式文件(*.bin)、稀疏主键索引(primary.idx)、标记文件(.mrk/.mrk2)与 index_granularity 如何协同,实现分区裁剪与跳读...

系列教程 预计阅读时间: 17 分钟 大数据与数据工程

大数据-55:Kafka 实战操作——Shell 管理命令与 Java 客户端示例

覆盖 Kafka 日常运维的 Shell 命令(主题管理、消息收发)与 Java 客户端编程(Producer/Consumer 完整代码),包含关键配置参数说明和 ConsumerRebalanceListener 使用。

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-56 Spring Boot 整合 Kafka 实现分布式消息收发

详解如何在 Spring Boot 项目中集成 Kafka,包括依赖配置、KafkaTemplate 同步/异步发送消息、@KafkaListener 消费消息的完整实践。

系列教程 预计阅读时间: 16 分钟 大数据与数据工程

大数据-135 ClickHouse 集群连通性自检 + 数据类型避坑实战|10 分钟跑通 ON CLUSTER

三节点(h121/122/123)为例,先完成集群连通性自检:system.clusters 校验 → ON CLUSTER 创建 ReplicatedMergeTree/Distributed → 分布式写读与迷你压测,确保复制与路由正常

系列教程 预计阅读时间: 16 分钟 大数据与数据工程

大数据-136 ClickHouse 集群 表引擎详解 选型实战:TinyLog/Log/StripeLog/Memory/Merge

梳理 ClickHouse 表引擎:TinyLog、Log、StripeLog、Memory、Merge 的原理、适用与坑点,并给出可复制的最小可运行示例与并发/文件核验脚本。通过选型决策表与 Do&Don't,帮你在小表、一次性写入...

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-53:Kafka 组件详解——Producer、Broker、Consumer 全流程

深入拆解 Kafka 三大核心组件的工作原理:Producer 分区策略与 ACK 机制、Broker 的 Leader/Follower 架构、Consumer Group 的分区分配与偏移量管理。

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-54:Kafka 安装部署——从 ZooKeeper 到 KRaft 的架构演进

介绍 Kafka 2.x 与 3.x 的核心差异,详细讲解集群安装步骤、ZooKeeper 配置、Broker 参数设置,以及 KRaft 模式如何彻底替代 ZooKeeper 依赖。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-133 ClickHouse 概念与基础|为什么快?列式 + 向量化 + MergeTree 对比

面向高并发、低延迟 OLAP 场景,本文从工程视角讲清 ClickHouse 的底层优势(列式+压缩+向量化、MergeTree 家族)、适用与不适用边界、数据建模基本法以及近似统计的性能-精度权衡。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-134 ClickHouse 单机+集群节点落地手册 | 安装配置 | systemd 管理 / config.d

官方推荐的 keyring + signed-by 在 Ubuntu 安装 ClickHouse,并用 systemd 启动与自检;提供单机最小示例(建库建表/插入/查询)。集群部分给出 ClickHouse Keeper 三节点最小配置与...