作业的提交和监控
Job为作业提交者提供了作业的视图,允许用户管理作业,提交作业,控制作业的执行和查询作业状态,比如跟踪map和reduce任务的执行进度。该类提供的set方法只有在作业已经被提交后才生效,否则将会抛出IllegalStateException异常。作业的提交过程包括:
1. 检查作业的输入输出规范。
2. 计算作业InputSplit的值。
3. 如果必要,设置作业的DistributedCache 的必需计费信息。
4. 拷贝作业的jar文件和配置管理文件到MapReduce在文件系统的目录中。
5. 提交作业到JobTracker并可选地监控其状态。
作业的历史文件被记录到由hadoop.job.history.user.location 指定的目录中,默认值为作业的输出目录,文件被存储到指定目录下的_logs/history/中。因此,默认情况,历史文件将被存放在mapred.output.dir/_logs/history中。用户可以通过将hadoop.job.history.user.location的值设置为none
Hadoop的Job类用于作业管理,包括提交、控制和查询作业状态。作业提交涉及输入输出规范检查、InputSplit计算、DistributedCache设置等步骤。作业历史日志默认存储在_output/_logs/history中。当mapred.acls.enabled开启时,作业级和队列级授权生效。作业的访问控制列表(ACL)用于授权浏览和修改作业,而安全集群中,用户需要获取HDFS和MapReduce令牌进行认证。
订阅专栏 解锁全文

991

被折叠的 条评论
为什么被折叠?



