본문 바로가기

빅데이터 플랫폼 & 아키텍처

9편. 금융권 실사용 예시 ① 신용평가 / 여신 리스크 모델링

반응형

🟧 9편. 금융권 실사용 예시 ① 신용평가 / 여신 리스크 모델링

금융권 Hadoop의 “핵심 활용 분야”는 바로 리스크 모델링(Risk Modeling) 이다.
Spark 기반 ML 파이프라인을 Hadoop에서 운영하는 가장 전형적인 사례다.


■ 1) 전체 모델링 아키텍처

HDFS Raw
   ▼
Refined Zone
   ▼
Spark Feature Engineering
   ▼
모델 학습 (Spark ML / Python)
   ▼
결과 저장 (Parquet)
   ▼
배치 API로 전송 → 여신 심사 시스템 반영

■ 2) Feature Engineering 코드 예시

txn = spark.read.parquet("/data/refined/transaction/")

feature = txn.groupBy("cust_id").agg(
    sum("amount").alias("total_amt"),
    avg("amount").alias("avg_amt"),
    count("*").alias("txn_cnt"),
    countDistinct("merchant").alias("merchant_diversity"),
    stddev("amount").alias("amount_std"),
)

■ 3) 모델 학습 예시 (Spark ML)

from pyspark.ml.feature import VectorAssembler
from pyspark.ml.regression import GBTRegressor

va = VectorAssembler(
    inputCols=["total_amt","avg_amt","txn_cnt","merchant_diversity","amount_std"],
    outputCol="features"
)

train = va.transform(feature)

model = GBTRegressor(labelCol="risk_score").fit(train)

실제로는 수백 개 컬럼을 feature로 사용한다.


■ 4) 모델 결과 운영 적용 프로세스

모델 평가 → 리스크위원회 검증 → 운영 반영 → 여신 심사 연계

운영 반영은 매우 까다롭고, 모델의 책임 부서가 명확히 정해져야 한다.


 실전 TIP 3개

① Spark ML보다는 Python PySpark + 외부 ML 라이브러리 조합이 더 유연하다
→ 금융권에서는 sklearn/XGBoost 활용 비중이 더 높음.

② 모델 출력값은 Parquet+Partition으로 저장해야 빠르게 연계된다
→ CSV는 큰 규모에서 절대 금지.

③ 모델 변경 시 “모델 버전 관리 테이블”을 반드시 두라
→ 금융감독원 감사 대응 시 필수.


 

반응형