Archive
文章
-
HDFS 源码阅读:09. 存储管理 (FsDatasetImpl)
深入 DataNode 内部的 FsDatasetImpl,解析 HDFS 如何在本地文件系统上组织 Block。
-
HDFS 源码阅读:10. 心跳与块汇报 (Heartbeat & BlockReport)
解析 DataNode 与 NameNode 之间的生命线:心跳机制、全量块汇报与增量块汇报。
-
HDFS 源码阅读:05. 持久化机制 (FsImage & EditLog)
解析 FSEditLog 的双缓冲机制与 Checkpoint 流程。
-
HDFS 源码阅读:02. 核心架构设计
HDFS 架构深度解析。Master/Slave 模式的优劣、Block 设计哲学以及 RPC 通信协议概览。
-
HDFS 源码阅读:13. 文件写入流程 (Write Path)
HDFS 最复杂的流程之一。解析 DFSOutputStream, DataStreamer, Packet 队列与 Pipeline 恢复机制。
-
HDFS 源码阅读:15. 高可用机制 (HA)
NameNode HA 是生产环境的标配。解析 ZKFC 选举机制与 QJM 共享存储原理。
-
HDFS 源码阅读:03. NameNode 启动流程
NameNode 启动全流程解析:从 main 函数入口到 RPC 服务就绪,以及 SafeMode 的处理逻辑。
-
HDFS 源码阅读:04. 元数据管理 (FSDirectory)
深入 FSDirectory 内部,解析 INode 内存结构与目录树的锁机制。
-
HDFS 源码阅读:01. 源码编译与环境搭建
HDFS 源码阅读第一步:源码下载、Maven 编译指南、IDEA 项目导入及远程调试环境配置。
-
HDFS 源码阅读:07. 租约管理 (LeaseManager)
HDFS 如何保证只有一个客户端能写入同一个文件?深入解析 LeaseManager 的软硬限制与恢复机制。
-
HDFS 源码阅读:08. DataNode 启动与注册
DataNode 启动全流程解析:从存储初始化、BlockPool 管理到向 NameNode 注册。
-
HDFS 源码阅读:16. Federation (联邦)
当单 NameNode 内存成为瓶颈时,Federation 允许水平扩展 Namespace。
-
HDFS 源码阅读:11. 数据传输协议 (DataTransferProtocol)
解析 HDFS 的数据高速公路:基于 TCP/Netty 的 DataTransferProtocol,以及 DataXceiver 的工作原理。
-
HDFS 源码阅读:12. DFSClient 初始化
DFSClient 是 HDFS 交互的入口。解析 DistributedFileSystem 与 DFSClient 的关系,以及 RPC 代理的创建。
-
HDFS 源码阅读:14. 文件读取流程 (Read Path)
解析 DFSInputStream 如何选择最优的 DataNode,以及 Checksum 校验机制。
-
HDFS 源码阅读:06. 块管理 (BlockManager)
BlockManager 是 NameNode 中最繁忙的组件,负责副本管理、损坏块处理与副本放置策略。
-
HDFS 源码阅读:17. 纠删码 (Erasure Coding)
Hadoop 3.0 的重磅特性。解析 EC 如何用 1.5 倍的存储开销实现 3 倍副本的可靠性。
-
HDFS 源码阅读:00. 阅读大纲与学习路线
Hadoop Distributed File System (HDFS) 源码阅读系列大纲。涵盖 NameNode 元数据管理、DataNode 存储引擎、客户端读写流程、HA 高可用机制等核心模块。