반응형
🟧 9편. 금융권 실사용 예시 ① 신용평가 / 여신 리스크 모델링
금융권 Hadoop의 “핵심 활용 분야”는 바로 리스크 모델링(Risk Modeling) 이다.
Spark 기반 ML 파이프라인을 Hadoop에서 운영하는 가장 전형적인 사례다.
■ 1) 전체 모델링 아키텍처
HDFS Raw
▼
Refined Zone
▼
Spark Feature Engineering
▼
모델 학습 (Spark ML / Python)
▼
결과 저장 (Parquet)
▼
배치 API로 전송 → 여신 심사 시스템 반영
■ 2) Feature Engineering 코드 예시
txn = spark.read.parquet("/data/refined/transaction/")
feature = txn.groupBy("cust_id").agg(
sum("amount").alias("total_amt"),
avg("amount").alias("avg_amt"),
count("*").alias("txn_cnt"),
countDistinct("merchant").alias("merchant_diversity"),
stddev("amount").alias("amount_std"),
)
■ 3) 모델 학습 예시 (Spark ML)
from pyspark.ml.feature import VectorAssembler
from pyspark.ml.regression import GBTRegressor
va = VectorAssembler(
inputCols=["total_amt","avg_amt","txn_cnt","merchant_diversity","amount_std"],
outputCol="features"
)
train = va.transform(feature)
model = GBTRegressor(labelCol="risk_score").fit(train)
실제로는 수백 개 컬럼을 feature로 사용한다.
■ 4) 모델 결과 운영 적용 프로세스
모델 평가 → 리스크위원회 검증 → 운영 반영 → 여신 심사 연계
운영 반영은 매우 까다롭고, 모델의 책임 부서가 명확히 정해져야 한다.
■ 실전 TIP 3개
① Spark ML보다는 Python PySpark + 외부 ML 라이브러리 조합이 더 유연하다
→ 금융권에서는 sklearn/XGBoost 활용 비중이 더 높음.
② 모델 출력값은 Parquet+Partition으로 저장해야 빠르게 연계된다
→ CSV는 큰 규모에서 절대 금지.
③ 모델 변경 시 “모델 버전 관리 테이블”을 반드시 두라
→ 금융감독원 감사 대응 시 필수.
🟦 금융권 하둡(Hadoop) 아키텍처 시리즈 (전 10편)
- 1편 — 금융권은 왜 하둡을 쓰는가: 도입 배경과 진화
- 2편 — 하둡 구성도: HDFS·YARN·Hive·Spark 운영 흐름
- 3편 — 운영 자동화 스크립트 모음 (금융권 표준)
- 4편 — 하둡 보안 아키텍처: 계정·권한·감사·데이터 보호
- 5편 — Job Template·배포 체계 표준화
- 6편 — Hadoop + Kafka 실시간 분석 아키텍처
- 7편 — 클러스터 운영 체계: 폐쇄망·보안·권한 관리
- 8편 — Sqoop·Oozie·Spark Batch 적재 파이프라인
- 9편 — 실사용 ①: 신용평가 / 여신 리스크 모델링 (현재 글)
- 10편 — 실사용 ②: FDS 이상거래탐지 로그 분석
반응형
'빅데이터 플랫폼 & 아키텍처' 카테고리의 다른 글
| Kafka Consumer Lag 실전 대응 — 원인 진단·리밸런싱·처리량 튜닝 (0) | 2026.07.26 |
|---|---|
| 10편. 금융권 실사용 예시 ② FDS(이상거래탐지) 로그 분석 (0) | 2025.12.01 |
| 8편. 데이터 적재 파이프라인 구축 – Sqoop/Oozie/Spark Batch 실전 (0) | 2025.12.01 |
| 7편. 금융권 하둡 클러스터 운영 체계 – 내부망·보안·권한 관리 완전 가이드 (0) | 2025.11.28 |
| 6편. Hadoop + Kafka 기반 실시간 분석 아키텍처 – End-to-End 구현 가이드 (0) | 2025.11.28 |