微光实验室 · 博客归档

博客 第29页

记录技术探索与工程思考,共 731 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java247后端工程50微服务9AI Engineering86LLM109Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
系列教程 预计阅读时间: 14 分钟 大数据与数据工程

大数据-174 Elasticsearch 查询 DSL 实战:match/match_phrase/query_string/multi_match

深入讲解 Elasticsearch 7.3 中查询 DSL 核心用法,重点拆解 match、matchphrase、querystring、multi_match 等全文检索语句在真实业务中的差异和坑位。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-71 Spark 集群架构与部署模式详解

深入解析 Spark 集群核心组件 Driver、Cluster Manager、Executor 的职责,对比 Standalone、YARN、Kubernetes 部署模式,并介绍静态与动态资源分配策略。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-171 Elasticsearch-Head 与 Kibana 7.3.0 实战:安装要点、连通性与常见坑

介绍 Elasticsearch-Head 插件与 Kibana 7.3.0 的安装与连通性要点,涵盖 Chrome 扩展快速接入、ES 集群健康与分片可视化、REST API 调试、Kibana Dashboard/Discover 使用...

系列教程 预计阅读时间: 5 分钟 大数据与数据工程

大数据-172 Elasticsearch 索引操作与 IK 分词器落地实战:7.3/8.15 全流程速查

Elasticsearch 索引创建、存在性判断(单/多/全量)、打开/关闭/删除与健康度排查,以及 IK 分词器的安装、ikmaxword / ik_smart 分析与远程扩展词典/停用词的 Nginx 托管方案。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-169 Elasticsearch 入门到可用:索引/文档 CRUD 与搜索最小示例

Elasticsearch(ES 7.x/8.x)最小示例:创建索引、插入文档、按 ID 查询、更新与 _search 搜索流程,配合返回样例与截图,帮助读者在 3–10 分钟内完成「索引/文档 CRUD」跑通。

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-170 Elasticsearch 7.3.0 三节点集群实战:目录/参数/启动到联机

Elasticsearch 7.3.0 三节点集群部署实战教程,涵盖目录创建与权限设置、系统参数配置(vm.maxmapcount、limits.conf)、JVM内存调整、elasticsearch.yml集群配置、分发与启动流程...

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-167 ELK Elastic Stack(ELK) 实战:架构要点、索引与排错清单

文章介绍 Elasticsearch 8.x、Logstash 8.x、Kibana 8.x 的核心能力与常见实践,覆盖集中式日志系统的采集、传输、索引、分片/副本、查询 DSL、聚合与 ILM 生命周期管理等关键环节。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-168 Elasticsearch 单机云服务器部署运行 详细流程

Elasticsearch是一个分布式全文搜索引擎,支持单节点模式(Single-Node Model)和集群模式(Cluster Model)部署,一般来说,小公司的业务场景往往使用Single-Node Mode部署即可。

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-165 Apache Kylin Cube7 实战:聚合组/RowKey/编码与体积精度对比

覆盖 Aggregation Group(聚合组)、Mandatory Dimension(强制维度)、Hierarchy(层级维度)、Joint(联合维度) 的使用取舍,并结合 CubeStatsReader 的精度/稀疏度读数与 Row...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-166 Apache Kylin 1.6 Streaming Cubing 实战:Kafka 到分钟级 OLAP

Kafka→Kylin 的实时 OLAP 链路,面向 2025 年常见业务(电商交易、用户行为、IoT 监控)提供分钟级聚合查询。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-69 Spark RDD 深度解析:五大特性、设计优势与典型应用场景

全面解析 Spark 核心数据抽象 RDD 的五大关键特征(分区、计算函数、依赖关系、分区器、优先位置),以及惰性求值、容错机制和窄/宽依赖的核心原理。

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-70 Spark RDD 创建与 Transformation 操作全攻略

详解 Spark RDD 的三种创建方式(parallelize、textFile、从已有 RDD 转换),以及 map、filter、flatMap、groupBy、sortBy 等常用 Transformation 算子的使用与惰性求值...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-163 Apache Kylin Segment 合并实战:手动/自动合并、保留策略与 JDBC 示例

Apache Kylin Segment合并实战教程,涵盖手动MERGE Job流程、连续Segment要求、Auto Merge多级阈值策略、Retention Threshold清理逻辑、删除流程(Disable→Delete)及JDB...

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-164 Apache Kylin Cuboid 剪枝实战:Derived 维度与膨胀率控制

Cuboid 剪枝优化:当维度较多时,Cuboid 数量指数级增长,导致构建时间长与存储膨胀。工程化做法:通过 CubeStatsReader 命令核查已物化 Cuboid 的行数/体积与 Shrink 比...

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-161 Apache Kylin Cube 实战:建模、构建与查询加速完整指南

Apache Kylin 4.0 的 Cube 建模与查询加速方法:围绕事实表与维度表完成星型建模,设计维度与度量,利用 Aggregation Group、层级维度、联合维度、必要维度等策略减少 Cuboid 组合,降低构建与存储开销;

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-162 Apache Kylin 增量 Cube 与 Segment 实战:按天分区增量构建指南

以 Hive 分区表的日期字段作为 Partition Date Column,将 Cube 拆分为多个 Segment,按区间增量构建,避免对历史数据的重复计算;并对比全量构建与增量构建在查询路径上的差异。

系列教程 预计阅读时间: 15 分钟 大数据与数据工程

大数据-159 Apache Kylin Cube 实战:Hive 装载与预计算加速(含 Cuboid/实时 OLAP)

OLAP 示例:用 Python 生成维度与事实数据,经 Hive(wzk_kylin)装载后,在 Kylin 侧设计 Cube(维度/度量/Cuboid),并给出分组聚合 SQL 的验证结果。

系列教程 预计阅读时间: 13 分钟 大数据与数据工程

大数据-160 Apache Kylin Cube 实战:从建模到构建与查询(含踩坑与优化)

Apache Kylin(3.x/4.x)Cube 的搭建与优化:从 DataSource → Model → Cube 的完整流程,覆盖维度建模、度量设计、Cuboid 预计算、Aggregation Group 剪枝、增量构建与查询命中。

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-67 从 MapReduce 到 Spark:大数据计算引擎三代演进全景解析

系统梳理大数据处理引擎从 MapReduce 到 Spark 再到 Flink 的演进脉络,解析 Spark 内存计算模型、统一生态与核心组件,帮助快速建立 Spark 全局认知。

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-68 Spark 分布式环境搭建:从下载配置到多节点集群部署

手把手搭建 Apache Spark 分布式计算环境,涵盖下载解压、环境变量配置、slaves/spark-env.sh 核心配置文件调整,以及三节点集群分发启动的完整流程。