ONLINE CLASS

하둡

COURSE FOCUS

이 강의에서 배우는 핵심 실무

하둡 환경을 준비하고 HDFS의 네임노드·데이터노드와 블록 구조를 살펴보며 분산 파일시스템을 이해합니다. 맵리듀스의 카운터와 다중 파일 출력, 스트리밍과 잡스케줄러를 다루고 하이브를 활용한 로그 데이터 분석을 진행합니다. 인기 URL을 찾는 예제와 테스트·디버깅을 통해 데이터 이동에서 분산 처리 결과 확인까지 작업 흐름을 익힙니다.

?

수강 전 꼭 확인하세요

수강 전 자주 묻는 내용을 간단히 안내드립니다.

Q초보자도 교재 없이 수강 가능한가요? 프로그램 정보는?
A

네, 영상과 실습자료로 쉽게 학습할 수 있습니다. 알지오는 원격평생교육원으로 프로그램 관련 정보는 제공하지 않습니다.

◆
기업이 선택한 신뢰 강의

검증된 커리큘럼과 전문 강사진으로 높은 만족도를 제공합니다.

자세히 보기  >
♥
수강료 일부는 사회환원에 사용됩니다.

작은 나눔이 더 나은 내일을 만듭니다.

자세히 보기  >
REAL REVIEW

수강생 리얼후기!

실제 수강생의 학습 경험을 확인해 보세요.

수강후기를 불러오는 중입니다.

RECENT Q&A

최근 수강질문

최근 등록된 수강질문을 작성순서대로 확인해 보세요.

ALZIO DEEP GUIDE

Apache Hadoop을 더 깊게 이해하기

20강의 HDFS·WordCount·항공 지연 분석·MapReduce 정렬과 조인·운영·Hive·자료 이동·Pig·테스트를 연결합니다. 저장·계산·분석 도구를 구분하며 Sqoop 같은 기존 생태계 도구의 현재 상태도 나누어 안내합니다.

공식 기술정보 확인20강 커리큘럼 연결2026 현재 기술정보

하둡 · 20강 · 13시간 10분

01

Apache Hadoop은 무엇인가

Hadoop은 분산 저장과 대용량 자료 처리를 위한 도구군입니다. HDFS의 저장·복제와 MapReduce의 계산·집계는 서로 다른 역할입니다. Hive·Pig·자료 이동 도구도 별도 프로젝트이며 같은 지원 상태를 갖는다고 가정하지 않습니다.

02

관련 플랫폼과 개발도구의 관계

HDFS는 NameNode의 메타데이터와 DataNode의 블록 저장을 나눕니다. MapReduce는 키·값 기반의 처리 단계를 연결하고 Hive는 SQL 중심 분석을 제공합니다. 서버 자원과 잡·자료 이동의 조건을 함께 봅니다.

03

Apache Hadoop의 핵심 기능

기술 자체의 기능과 이 강좌의 직접 학습 범위는 다릅니다. 아래 연결 표시는 저장된 공개 커리큘럼에 근거합니다.

HDFS

분산 파일 저장과 메타데이터를 관리합니다. 블록·복제를 읽는 기반입니다. 일반 로컬 파일의 임의 수정과 같은 방식으로 보지 않습니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인

MapReduce

분산 계산과 키별 집계를 연결합니다. WordCount와 조인 흐름을 설명합니다. 자료 분할만으로 모든 계산이 빨라지지는 않습니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인

정렬·조인

중간 자료의 묶음과 관계를 다룹니다. shuffle의 비용과 키 분포를 확인합니다. combiner를 모든 연산에 적용할 수는 없습니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인

운영·자원

노드·저장 상태와 작업 자원을 관리합니다. 장애와 결과 확인을 구분합니다. 복제가 별도 백업을 자동으로 대신하지 않습니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인

Hive·Pig

SQL·자료 흐름의 별도 표현을 제공합니다. 저장·계산과 질의의 역할을 나눕니다. 프로젝트별 버전·실행 조건은 확인해야 합니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인

자료 이동

로그·DB·파일을 분석 흐름에 연결합니다. 입력·출력 형식과 완료 상태를 읽습니다. 오래된 도구를 현행 기본 구성으로 소개하지 않습니다.

기술 참고 · 직접 학습 여부는 아래 회차 연결표에서 확인
04

이 과정의 실제 작업 흐름

1~4강은 Linux·Java·설정·HDFS·블록·입출력·MapReduce·WordCount이며 5~8강은 항공 자료 분석·옵션·카운터·여러 출력·정렬·조인·shuffle입니다.

9~13강은 combiner·압축·블록·JVM·투기 실행·HA·노드·복구·스트리밍·스케줄러·HiveQL·분석입니다. 14~16강은 Flume·기존 수집 도구·Oozie·Sqoop·자료 이동, 17~20강은 Hive 조인·Pig·UDF·최적화·Crunch·Cascading·테스트·디버깅입니다.

  1. 환경·HDFS
  2. WordCount·분석
  3. 정렬·조인·튜닝
  4. 노드·잡 운영
  5. Hive·자료 이동
  6. Pig·테스트
05

핵심 구조를 이해하는 방법

Map의 중간 결과가 shuffle과 정렬·그룹을 거쳐 Reduce로 전달됩니다. 자료가 많은 곳의 접근 비용과 키 분포가 처리량에 영향을 줍니다. 복제된 저장과 계산 결과·백업은 목적과 확인 방식이 다릅니다.

06

실무 적용과 결과 확인

4~8강을 복습하면서 입력·Map 결과·키별 묶음·최종 집계의 자료량을 기록해 보세요. 키가 치우친 경우와 균일한 경우 비교는 추가 연습입니다. 결과 파일이 있다는 사실만으로 집계가 맞다고 판단하지 않습니다.

9~20강은 노드 상태·잡 완료·자료 이동·질의 결과를 따로 점검하세요. 로그와 예상 행 수를 대조하는 추가 응용입니다. 실제 클러스터 설정이나 장애 복구를 이 안내에서 실행하지 않습니다.

07

이 강좌에서 집중할 전문주제

전문 축은 MapReduce의 정렬·조인과 처리 비용입니다. 5~9강의 항공 분석·키 정렬·조인 위치·압축·combiner를 연결해 중간 자료가 어디에서 늘어나는지 읽으세요.

후반은 서로 다른 표현과 자료 이동의 연결입니다. HiveQL·Pig Latin·UDF·분석 결과를 같은 언어로 취급하지 않습니다. 생태계 전체가 현재 동일한 구성으로 권장된다는 주장도 하지 않습니다.

08

현재 기술과 강좌 환경의 관계

정확한 Hadoop·Java·Hive 버전은 공개 목록으로 확정하지 않습니다. 당시 이클립스·contrib·기존 수집 도구와 현재 실행환경은 분리합니다.

Sqoop은 Apache Attic의 은퇴 프로젝트로 안내됩니다. 당시 DB 이동 학습과 현재 도구 선택은 별개이며 모든 Hadoop 관련 프로젝트가 은퇴한 것으로 확대하지 않습니다. Pig·Hive는 각 공식 프로젝트의 별도 상태를 확인합니다.

09

목적에 맞는 기술 선택과 비교

아래 비교는 목적과 작업 구조를 선택하기 위한 안내입니다. 다른 기술 전체를 본 강좌에서 가르친다는 뜻은 아닙니다.

목적에 맞는 기술 선택과 비교
선택지작업 접근이 강좌와의 관계
HDFS분산 저장과 블록2~4강
MapReduce키·값 계산·집계4~11강
Hive·PigSQL·자료 흐름 표현12~19강
10

기술개념과 알지오 커리큘럼 연결

회차는 공개 커리큘럼의 실제 순서입니다. 실습 후 응용 제안과 현재 기술 참고정보를 강의에서 제공하는 실습으로 해석하지 않습니다.

기술개념과 알지오 커리큘럼 연결
기능·개념무엇인가실무 의미강좌 회차학습 상태
환경·저장Java·설정·HDFS·WordCount자료와 계산1·2·3·4강강좌에서 직접 학습
분석·정렬·조인항공 자료·카운터·shuffle중간 결과5·6·7·8강강좌에서 직접 학습
튜닝·운영노드·HA·복구·스트리밍·스케줄자원과 완료9·10·11·12강강좌에서 직접 학습
Hive·자료 이동질의·수집·Oozie·Sqoop도구별 조건13·14·15·16강강좌에서 직접 학습
Pig·테스트UDF·정렬·최적화·디버깅결과 검증17·18·19·20강강좌에서 직접 학습
11

처음 배울 때 자주 생기는 오해

HDFS가 DB 질의 엔진인가?

분산 파일 저장입니다. 질의 도구는 별도입니다. 2~4강과 12~13강을 나누세요.

복제가 백업인가?

목적이 다릅니다. 저장 상태와 복구 경로를 확인합니다. 9~10강의 운영을 전체 백업 보장으로 바꾸지 않습니다.

combiner는 모든 계산에 쓰나?

연산 조건에 달려 있습니다. 9강의 결과를 대조합니다. 중간 집계가 의미를 바꾸지 않는지 확인하세요.

정렬과 조인이 항상 빠른가?

중간 자료와 분포에 따라 다릅니다. 7~9강의 shuffle을 연결합니다. 도구명만으로 성능을 보장하지 않습니다.

Sqoop이 현행 권장 도구인가?

공식 은퇴 상태를 구분합니다. 15강은 당시 자료 이동 맥락입니다. 현재 대안은 목적과 환경별로 확인합니다.

Hive와 Pig가 같은 언어인가?

SQL과 자료 흐름 표현이 다릅니다. 12~19강을 역할별로 읽습니다. 모든 프로젝트를 같은 지원 상태로 묶지 않습니다.

12

다음 학습 방향

리눅스 서버관리 [입문+고급]

Linux 서버·네트워크 기반을 보강합니다.

자료 보기 →

사이킷런 [머신러닝]

자료 분할과 머신러닝 평가를 별도로 학습합니다.

자료 보기 →

Apache Hadoop 관련 과정 비교

입문·실무·심화 과정의 실제 커리큘럼을 목적에 맞게 비교합니다.

자료 보기 →

실습과 복습 계획

새 환경에서 예제를 확인하고 학습 계획을 세우는 방법을 살펴봅니다.

자료 보기 →

기술정보는 Apache Software Foundation의 공식자료를 기준으로 검토했으며, 강좌 범위는 하둡의 공개 커리큘럼과 구분했습니다.

공식 기술정보 확인일: 2026-10-05 · 강좌 업데이트일을 의미하지 않습니다.

하둡 하둡
  • 하둡

  • 강의구성
  • (20강) 전체 : 13시간 10분|평균 : 39분30초
  • 이용기간/강사
  • 2개월
    알지오 R&D [IT] ▶ 프로필 보기
  • 증빙가능
  • 수료증, 수강증, 학습진도
  • 수강료
  • 250,000원할인125,000원
?

수강 전 꼭 확인하세요

수강 전 자주 묻는 내용을 간단히 안내드립니다.

Q 초보자도 교재 없이 수강 가능한가요? 프로그램 정보는?
A

네, 영상과 실습자료로 쉽게 학습할 수 있습니다. 알지오는 원격평생교육원으로 프로그램 관련 정보는 제공하지 않습니다.

  • 01.38분 hadoop의 소개와 개발 준비
    빅데이터, 하둡 에코 시스템, ETL, 실행모드, 리눅스 서버 준비, 호스트 파일 수정, 인코딩 방식 설정, 자바와 하둡 설치
    빅데이터의 정의, 빅데이터의 특징, 빅데이터의 3대 요소, 비정형 데이타, 하둡과 관련된 제품, scribe, 설치 파일 실행, ssh 접속 시도
  • 02.36분 개발 준비와 하둡 분산 파일 시스템
    하둡 환경설정 파일 수정, 하둡 실행, 예제 실행, 이클립스 설정, 프로젝트 빌드, HDFS 기초, HDFS 아키텍처, 네임노드와 데이터노드, 블록구조 파일시스템
    환경 설정 파일 수정, hadoop classpath 옵션, dfs.http.address, jps로 하둡 실행 여부 확인, 빌드 결과 확인, 네임노드와 데이터노드
  • 03.38분 HDFS의 파일 저장 동작방식과 읽기 동작방식
    HDFS 기초, HDFS 아키텍처, HDFS 명렁어 사용, 클러스터 웹 인터페이스
    파일 저장에 대한 동작방식 그림, 데이터 저장시 장애가 발생할 경우, 에디트 로그와 파일 시스템 이미지의 동작방식, HDFS 명령어 사용법, mv 명령어, stat 명령어, Dead Nodes
  • 04.37분 HDFS 입출력과 맵리듀스
    HDFS 입출력 예제, 맵리듀스 개념, 아키텍처, WordCount
    HDFS 입출력 예제, 맵과 리듀스의 동작, 잡 할당 과정, Interface Writable, 매퍼 클래스 소스코드 보기, class OutputFormat, class LazyOutputForma
  • 05.36분 WordCount 맵리듀스 프로그램
    분석용 데이터, 항공 출발 지연 데이터 분석, 항공 도착 지연 데이터 분석
    WordCount 맵리듀스 프로그램 만들기, 자세한 소스 보기, 리듀스 메소드 재정의, 출력 로그 자세히 보기, 필요한 데이터 다운, 출력 데이터 생성 확인, 사용자 정의 옵션 사용
  • 06.32분 맵리듀스 기초
    사용자 정의 옵션, 카운터 사용, 다수의 파일 출력, 체인
    사용자 정의 옵션, GenericOptionsParser, Interface Tool, 로그 보기, Class MultipleOutputs, 매소드 보기, 세번째 매퍼 설정할 경우
  • 07.38분 맵리듀스 정렬 구현
    보조 정렬, 부분 정렬, 전체 정렬
    정렬 구현, 보조 정렬 순서, 복합키 비교기 보기, 리듀서 소스 보기, 맵 리듀스 파일 실행, 전체 정렬 작동 방식, 정렬 확인
  • 08.40분 조인과 맵리듀스 튜닝
    주인 구현, 조인 준비, 맵-사이드 조인, 리듀스-사이드 조인, 셔플 튜닝
    조인, Class DistributedCache, 리듀스-사이드 조인, 출력 경로 조회, 리듀스, 주의할 점
  • 09.44분 맵리듀스 튜닝과 하둡 운영
    콤바이너 클래스 적용, 맵 출력 데이터 압축, DFS 블록 사이즈 수정, JVM 재사용, 투기적 잡 실행, 네임노드 HA 구성, 파일시스템 상태 확인, HDFS 어드민 명령어
    콤바이너 클래스 적용, snappy, ArrivalDelayCount에 snappy 적용, 결과 비교, 개별적인 잡에 대한 투기적 잡 실행, 생성자 로그의 정보 보기, -saveNamespace 옵션, 파일 저장 용량 설정 방법
  • 10.43분 하둡 운영
    데이터 저장공간 관리, 데이터노드 제거 및 추가, 네임노드와 데이터노드 장애복구, 하둡 사용자 관리, 하둡 주요 포트
    데이터 저장공간 관리, 데이터노드 제거/데이터노드 추가, hdfs-site.xml 파일 내용 보기, 에러가 나는 이유, 네임노드 메타데이타 이중화, 하둡 부가기능, 제너릭 옵션 설명, -archives
  • 11.37분 하둡 부가기능
    하둡 스트리밍, 스트리밍 실행 옵션, 스틀리밍 구현, 잡스케줄러
    하둡 스트리밍 구현, 첫번째 job 구현, 명령어 파이프라인 사용, 하둡 스트리밍 실행, 페어스케줄러, 풀 설정 파일 정의, 전체에 대한 속성 보기
  • 12.39분 하둡 부가기능과 하이브
    페어 스케줄러, 커패시티 스케줄러, contrib 패키지, 하이브 아키텍처, 하이브 설치, 하이브QL, 하이브 칼럼 타입
    페어 스케줄러 적용, 커패시티 스케줄러, 속성값 살펴보기, 관리 화면에서 queue 조회, 구성요소 보기, 테이블 생성 내용, drop 테이블
  • 13.40분 하이브QL과 하둡 적용
    데이터업로드, 하이브 내장집계함수, 하이브 내장함수, 조인, 조인 제약사항, 버킷활용, 하둡과 몽고DB 이용, 히둡 에코시스템 활용한 분석 플랫폼 구축, 빅데이터 기술 이용한 소셜 네트워크 데이터 분석
    데이터 업로드, 첫번째 라인 삭제한 이유, 하이브 주요 내장함수, 조인하기, 스토리지 사용 추이 데이터 보기, 확장성과 실시간성 확보, sns 데이터 분석 시스템 구성
  • 14.37분 하둡 데이터 이동 part1
    인그레스, 이그레스, 플룸 아키텍처, 스크라이브 아키텍처, 추크와 아키텍처, 하둡에 로그파일 집어넣기
    하둡 데이터의 이동, 복구 가능성, 하둡으로 데이터를 옮길때 쓸수 있는 주된 방법, 플룸 노드 데몬 시작 화면, 플룸 마스터에서 설정 변경하는 방법, 장애극복 모드, 출력 포맷 보기
  • 15.45분 하둡 데이터 이동 part2
    반구조화된 데이터 및 바이너리 파일 집어넣고 가져오기, 파일슬러퍼, 우지, 데이터베이스로부터 데이터 풀링, 맵리듀스활용, 스쿱
    반구조화된 데이터 및 바이너리 파일 집어넣고 가져오기, 파일 슬러퍼, 슬러퍼의 중요한 특징, 실제 작업 흐름 보기, DB 구조 살펴보기, 두가지 예제 더 보기, 맵 리듀스의 데이터 소스로서 HBase를 사용하는 경우
  • 16.40분 하둡 데이터 이동 part3
    하둡 밖으로 데이터 옮기기, 로컬 파일시스템으로의 이그레스, 데이터베이스, HBase, 하이브를 활용한 데이터 분석, 로그 파일 로딩, UDF 및 압축 파티션 테이블 쓰기
    하둡 밖으로 데이터 옮기기, input-fields-terminated-by, HBase shell 에서 테이블 만들기, 직렬화 및 역직렬화(SerDe), RegexSerDe 작동 보기, 버킷 설정 두가지 방법, udf 클래스 살펴보기, description 보기
  • 17.44분 하이브 활용과 피그
    하이브를 활용한 데이터 분석, 하이브 조인 튜닝, 그루핑, 정렬, Explain, 피그 기본, 피그로 데이터 로드
    하이브 조인 튜닝, Full outer join, 세미 조인, 피그 라틴 데이터 타입 보기, 완전한 기능을 갖춘 로그 로더 제공 방법, 로드 하기, 커먼 로그 로드 펑션을 사용해 로드 하는 법 알아보기
  • 18.42분 피그
    피그 파이프라인, 필터링 및 투영, UDF 그루핑 및 취합, UDF 활용 위치 찾기, 스트리밍, 조인, 정렬, 데이터저장
    필터링, 투영, 필터링 과정, 필터 연산 결과로 ip 주소별로 로그 엔트리 그루핑하고 계산하기, getfinal, exec 메소드, 스트리밍, 시퀀스 파일로 저장하는 이유, 커스텀 로드 펑션 실행
  • 19.40분 피그와 그런치 및 그 외 기술
    사용자 작업 흐름 최적화, LIMIT, SAMPLE, ILLUSTRATE, EXPLAIN, 성능, 그런치
    사용자 작업 흐름 최적화, RandomSampleLoader 인자 보기, Map Reduce Plan, 피그에서 리듀서를 사용하는 연산자, configure 메서드, 크런치에서 완전한 맵 리듀스 잡 실행하기, uniqueValues 메서드 살펴보기
  • 20.44분 데스트와 디버깅
    로그에서 가장 인기있는 URL 찾기, 조인, 케스케이딩, 튜플, 파이프, 탭, 테스트, 사용자 공간 문제 디버깅, 맵리듀스 주의 사항
    로그에서 가장 인기있는 URL 찾기, initialize를 통한 선언 초기화, 크런치 조인 파이프라인, 테스트 요소 살펴보기, run 메서드, 테스크 출력 값 보기, 투기적 실행 경쟁 조건, 지나치게 많은 카운터

강의목록 다운로드                        1:1 강의 질문&답변






도움이 필요하신가요?
💬
알지오 학습·수강 도우미
운영진이 확인한 안내를 자세히 보고, 필요하면 바로 상담하세요.
상담 상태 확인 중