《前后端面试题》专栏集合了前后端各个知识模块的面试题,包括html,javascript,css,vue,react,java,Openlayers,leaflet,cesium,mapboxGL,threejs,nodejs,mangoDB,SQL,Linux… 。

文章目录
- 一、本文面试题目录
-
-
- 16. 什么是HDFS?它的设计理念是什么?
- 17. HDFS的架构由哪些组件构成?各组件的作用是什么?
- 18. NameNode和DataNode的职责分别是什么?
- 19. 简述HDFS的读写流程。
-
- 读流程:
- 写流程:
- 20. HDFS中的块(Block)是什么?默认大小是多少?为什么块设置得较大?
- 21. 什么是副本机制?HDFS默认副本数是多少?副本放置策略是什么?
- 22. Secondary NameNode的作用是什么?它与NameNode的关系?
- 23. NameNode如何管理元数据?元数据保存在哪里?
- 24. 什么是NameNode的“安全模式”?如何进入和退出?
- 25. DataNode的心跳机制和块报告的作用是什么?
- 26. HDFS如何处理文件的追加操作?早期版本为什么不支持?
- 27. HDFS的Federation(联邦)机制解决了什么问题?
- 28. HDFS的HA(高可用)架构如何实现?解决了什么问题?
- 29. 如何在HDFS中创建、删除、复制文件?(命令行操作)
- 30. HDFS的“均衡器”(Balancer)的作用是什么?如何使用?
- 31. 什么是HDFS的“回收站”机制?如何配置?
- 32. HDFS支持的压缩格式有哪些?如何选择?
- 33. 如何监控HDFS的状态?(如命令或工具)
- 34. HDFS中文件损坏如何检测和修复?
- 35. HDFS的局限性有哪些?(如不适合小文件、低延迟访问等)
-
- 二、110道Hadoop面试题目录列表
一、本文面试题目录
16. 什么是HDFS?它的设计理念是什么?
- 定义:HDFS(Hadoop Distributed File System)是Hadoop生态系统中的分布式文件系统,专为大规模数据存储和处理设计,运行在廉价的 commodity 硬件上。
- 设计理念:
- 海量数据存储:支持PB级甚至EB级数据存储,适合处理大规模数据集。
- 流式数据访问:强调数据的批量处理(一次写入、多次读取),而非低延迟的随机读写,优化了吞吐量。
- 容错性:通过副本机制(默认3个副本)应对硬件故障,确保数据可靠性。
- 简单的一致性模型:假设文件一旦写入后很少修改,主要支持追加操作(早期版本不支持,后期逐步完善),降低了分布式协调的复杂度。
- 硬件友好:可运行在普通服务器上,降低成本,同时通过软件层面的设计弥补硬件可靠性不足的问题。
17. HDFS的架构由哪些组件构成?各组件的作用是什么?
HDFS采用主从(Master-Slave)架构,主要组件包括:
- NameNo
订阅专栏 解锁全文
2978

被折叠的 条评论
为什么被折叠?



