微光实验室 · 博客归档

博客 第28页

记录技术探索与工程思考,共 731 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java247后端工程50微服务9AI Engineering86LLM109Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-189 Nginx JSON 日志接入 ELK:ZK+Kafka+Elasticsearch 7.3.0+Kibana 7.3.0

通过 Nginx 配置 logformat json 输出结构化 accesslog(包含 @timestamp、requesttime、status、requesturi、ua 等字段),在多节点(h121/h122/h123)启动 Zo...

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-190 Filebeat→Kafka→Logstash→Elasticsearch 实战

Filebeat 采集 Nginx access.log 写入 Kafka,Logstash 从 Kafka 消费后按字段(app/type)条件解析 message 内嵌 JSON,叠加 GeoIP(GeoLite2-City.mmdb)...

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-187 Logstash Filter 插件实战:grok 解析控制台与 Nginx 日志(7.3.0 配置)

文章讲解在 Logstash 7.3.0 环境下,用 grok 从控制台 stdin 与 Nginx 访问日志中提取结构化字段(IP、time_local、method、request、status 等)...

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-188 Logstash Output 插件实战:stdout/file/Elasticsearch 输出与条件路由

Logstash Output 插件(Logstash 7.3.0)实战教程,涵盖 stdout(rubydebug)用于联调验数、file 输出用于本地归档、Elasticsearch 输出用于检索分析。

系列教程 预计阅读时间: 3 分钟 大数据与数据工程

大数据-185 Logstash 7 入门实战:stdin/file 采集、sincedb/start_position 机制

Logstash 7 入门教程,涵盖 stdin/file 采集、sincedb 机制与 start_position 生效条件,附带错误速查表

系列教程 预计阅读时间: 3 分钟 大数据与数据工程

大数据-186 Logstash JDBC vs Syslog Input:原理、场景对比与可复用配置(基于 Logstash 7.3)

Logstash Input 插件对比,拆解 JDBC Input 与 Syslog 采集链路的技术差异、适用场景与关键配置。JDBC 通过 JDBC 驱动连接 MySQL 等关系型数据库,结合 sqllastvalue...

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-73 Spark + Scala 实现 WordCount 入门实践

使用 Spark + Scala 和 Spark + Java 两种方式实现分布式 WordCount,详解 RDD 五步处理流程、Maven 项目配置和 spark-submit 提交命令。

系列教程 预计阅读时间: 6 分钟 大数据与数据工程

大数据-74 Spark Scala 实战:蒙特卡洛求 Pi 与共同好友分析

通过两个经典案例深入 Spark RDD 编程:蒙特卡洛方法分布式估算 π 值,以及两种思路实现社交网络共同好友分析,对比笛卡尔积与数据变换的性能差异。

系列教程 预计阅读时间: 2 分钟 大数据与数据工程

大数据-183 Elasticsearch - 并发冲突与乐观锁、分布式数据一致性剖析

Elasticsearch 并发冲突(库存扣减的读-改-写)拆解写覆盖成因,并用 ES 的乐观并发控制(OCC)给出工程解法:通过 ifseqno 与 ifprimaryterm 让更新具备条件写入,当文档已被其他请求修改时返回 versi...

系列教程 预计阅读时间: 2 分钟 大数据与数据工程

大数据-184 Elasticsearch Doc Values 机制详解:列式存储如何支撑排序/聚合/脚本

索引时生成的磁盘列式数据结构,面向排序、聚合与脚本取值优化;多数支持类型默认开启,text 字段默认不提供 doc values,需通过 keyword 子字段或启用 fielddata 才能聚合/排序。

系列教程 预计阅读时间: 4 分钟 大数据与数据工程

大数据-181 Elasticsearch 段合并与磁盘目录拆解:Merge Policy/Force Merge/配置

解释 refresh 导致小段增多、段合并如何在后台把小段并入大段并清理已删除文档,为什么段过多会带来句柄/内存/CPU与查询开销。工程侧给出 merge 相关配置点:merge scheduler 线程数...

系列教程 预计阅读时间: 2 分钟 大数据与数据工程

大数据-182 Elasticsearch 倒排索引底层拆解:Terms Dictionary/FST/SkipList/Lucene

文章详细解析 Elasticsearch 倒排索引的核心数据结构:Terms Dictionary(词典)、Posting List(倒排表)、FST(有限状态转换器)与 SkipList(跳表)在查询阶段如何加速 Term 定位与 pos...

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-179 Elasticsearch 倒排索引与读写流程全解析:从 Lucene 原理到 Query/Fetch

文章解析 Elasticsearch 倒排索引原理,对比正向索引与倒排索引差异,涵盖分词、Term Dictionary、Posting List 等核心概念。详述文档写入的分片路由规则(hash(routing) % numberofpr...

系列教程 预计阅读时间: 14 分钟 大数据与数据工程

大数据-180 Elasticsearch 近实时搜索:Segment/Refresh/Flush/Translog 机制

文章详细解析 Elasticsearch 近实时搜索的核心机制,包括 Lucene Segment、Memory Buffer、File System Cache、Refresh、Flush 及 Translog(事务日志)等核心组件...

系列教程 预计阅读时间: 10 分钟 大数据与数据工程

大数据-72 Spark Action 操作全景解析

全面介绍 Spark RDD 的 Action 操作,涵盖数据收集、统计聚合、元素检索、存储写出等类别,并详解 Key-Value RDD 的 groupByKey、reduceByKey、join 等核心算子。

系列教程 预计阅读时间: 7 分钟 大数据与数据工程

大数据-177 Elasticsearch 聚合实战:指标聚合 + 桶聚合完整用法与 DSL 解析

覆盖指标聚合 Metrics Aggregations 与桶聚合 Bucket Aggregations 的完整实践,适用于 2025 年常见的 Elasticsearch 7.x / 8.x 版本。

系列教程 预计阅读时间: 9 分钟 大数据与数据工程

大数据-178 Elasticsearch 7.3 Java 实战:索引与文档 CRUD 全流程示例

elasticsearch-rest-high-level-client 实现索引和文档的增删改查,包括:通过 JSON 与 XContentBuilder 两种方式创建索引、配置分片与副本、删除索引、插入单条文档...

系列教程 预计阅读时间: 12 分钟 大数据与数据工程

大数据-175 Elasticsearch Term 精确查询与 Bool 组合实战:range/regexp/fuzzy/ids

本文演示 Elasticsearch term-level queries 包括 term、terms、range、exists、prefix、regexp、fuzzy、ids 查询,以及 bool 复合查询。

系列教程 预计阅读时间: 5 分钟 大数据与数据工程

大数据-176 Elasticsearch Filter DSL 全面实战:过滤查询、排序分页、高亮与批量操作

本文介绍 Filter DSL 与 query 的区别:Filter DSL 不计算相关度评分,专门优化过滤场景的执行效率。涵盖 bool + filter + range 数值/日期范围过滤、基于 score 排序、单/多字段排序、分页...

系列教程 预计阅读时间: 8 分钟 大数据与数据工程

大数据-173 Elasticsearch 映射与文档增删改查实战(基于 7.x/8.x)

本文详细介绍 Elasticsearch 7.x/8.x mapping 配置与文档 CRUD 操作,包括索引/字段映射创建、映射属性(type、index、store、analyzer)、文档创建、查询、全量/局部更新...