About me
数据之中,
秩序之间。
我是 WEI,一名大数据开发工程师。
负责 Elasticsearch 大规模集群与 ClickHouse 集群的日常维护、读写调优与架构演进。同时使用 Go 参与数据扫描、富化、入库的全链路开发,配合 Spark 完成大规模批处理。
在大规模数据中寻找秩序,相信工程的力量。
Role
Big Data Engineer
Focus
ES · CH · Go
ES Scale
Production
Go Usage
Scan · Enrich
Batch
Spark · HDFS
Storage
ES · ClickHouse
Messaging
Kafka
Value
Long-Term
Tech Stack
Elasticsearch 运维
大规模生产集群的日常维护:分片策略、mapping 设计、读写调优、节点扩缩容与故障恢复。
ClickHouse 集群
ClickHouse 集群维护与读写优化:MergeTree 引擎选型、分区索引设计、物化视图,海量数据秒级查询。
Go 数据开发
使用 Go 编写数据扫描、富化、入库服务。高并发接入 Kafka 消息,处理后批量写入 ES / ClickHouse。
Spark 批处理
Spark 大规模离线批处理:HDFS 数据读取、清洗转换、写入 ES/ClickHouse,大规模 ETL 作业调度。
Build
01 ES 大规模集群读写调优与日常维护 Elasticsearch · 生产集群 →
生产级搜索集群的长期维护者:负责架构演进、读写性能与稳定性治理,让海量数据始终可查、可写、可恢复。
架构演进
性能治理
稳定性保障
故障恢复
02 Go 数据扫描富化入库服务 Go · Kafka · ES →
从 Kafka 高并发消费原始数据,经扫描、解析、富化后批量写入 ES / ClickHouse。pipeline 化并发模型 + 批量聚合提交 + 失败重试与死信兜底,吞吐与稳定性两手抓。
goroutine pipeline
批量提交
失败重试
03 ClickHouse 集群维护与查询优化 ClickHouse →
MergeTree 家族引擎选型与表结构设计,分区键 / 主键索引规划,物化视图预聚合,让常用查询稳定在秒级以内。
MergeTree
分区索引
物化视图
04 Spark 大规模离线 ETL 作业 Spark · HDFS →
HDFS 上的海量数据清洗、转换与对齐,输出至 ES / ClickHouse 供在线查询。关注资源调优、数据倾斜治理与作业调度稳定性。
数据倾斜治理
资源调优
作业调度
Writing
大规模 ES 集群:读写调优实战笔记
从分片策略、mapping 设计到 bulk 写入与慢查询治理,分享大规模集群日常维护中的真实经验。
$ curl _cluster/health
{"status":"green"}
"unassigned":"0"
"query":"fast"
"alerts":"none"
{"status":"green"}
"unassigned":"0"
"query":"fast"
"alerts":"none"
用 Go 写数据富化入库服务:从扫描到落库的全链路设计
ClickHouse vs Elasticsearch:大数据场景下的选型与取舍
AI × ME
AI 时代来了,先上车。
"2027,人类命运的十字路口。" — Dario Amodei
代码是 AI 写的,bug 是 AI 留的,但 review 是我做的,所以锅还是我的。
10x
编码效率提升(保守估计)
∞
AI 的加班时长
ai_agent.sh
# 让 AI 帮我查 ES 集群状态
$ hermes "检查 ES 集群健康"
🤖 正在连接生产集群 ...
🤖 集群状态: GREEN ✅
🤖 节点: 全部在线 · 分片: 分配均衡
🤖 读写水位: 正常
🤖 未分配分片: 0 · 无异常
# 再让它帮我写个 Go 入库脚本
$ hermes "写个 Go bulk 写入 ES"
🤖 已生成 enrich_bulk.go
🤖 含错误重试 + 批量提交
🤖 已通过本地测试
✓ 已保存到 ./enrich_bulk.go
$
GET IN TOUCH / 联系
Let's talk.
如果你对大数据、Go 工程化、数据管道设计感兴趣,欢迎交流。