반응형
🟧 10편. 금융권 실사용 예시 ② FDS(이상거래탐지) 로그 분석
FDS(Fraud Detection System)는 하둡의 가장 강력한 활용 분야다.
로그 규모가 매우 크고, 실시간 분석에 Hive + Spark이 자주 사용된다.
■ 1) FDS 데이터 구조
로그 종류: 결제로그, 접속로그, API 호출로그, 단말기 정보, IP 정보
일일 데이터: 수억 건
■ 2) Kafka → Hadoop 적재 구조
Kafka
▼
Flume / Spark Streaming
▼
HDFS Raw
▼
Hive Partitioned Table
■ 3) FDS 실시간 의심 거래 탐지 Spark 코드 예시
txn = spark.sql("""
SELECT cust_id, amount, country, ip, device_id, dt
FROM fds_txn
WHERE dt = '2024-01-01'
""")
susp = txn.filter(
(txn.amount > 500000) &
(txn.country != 'KR') &
(txn.ip.startswith('10.') == False)
)
■ 4) FDS 튜닝 포인트
- Partition key를 datetime으로 설정
- Spark Executor 메모리를 크게 할당
- Skew 데이터(특정 고객 몰림) 분산 처리
- Parquet + Snappy 압축 필수
■ 실전 TIP 3개
① FDS는 ETL 실패가 곧 장애다 → 적재 모니터링 반드시 자동화
→ Slack 또는 사내 메신저 알림 필요.
② Data Skew는 bucket table로 해결 가능
→ 특정 고객 트래픽이 몰릴 때 특히 효과적.
③ 실시간성 요구가 높으면 Kafka → Spark Streaming → Redis 캐시 조합이 가장 안정적
→ 금융권에서 가장 널리 쓰는 구조.
🟦 금융권 하둡(Hadoop) 아키텍처 시리즈 (전 10편)
- 1편 — 금융권은 왜 하둡을 쓰는가: 도입 배경과 진화
- 2편 — 하둡 구성도: HDFS·YARN·Hive·Spark 운영 흐름
- 3편 — 운영 자동화 스크립트 모음 (금융권 표준)
- 4편 — 하둡 보안 아키텍처: 계정·권한·감사·데이터 보호
- 5편 — Job Template·배포 체계 표준화
- 6편 — Hadoop + Kafka 실시간 분석 아키텍처
- 7편 — 클러스터 운영 체계: 폐쇄망·보안·권한 관리
- 8편 — Sqoop·Oozie·Spark Batch 적재 파이프라인
- 9편 — 실사용 ①: 신용평가 / 여신 리스크 모델링
- 10편 — 실사용 ②: FDS 이상거래탐지 로그 분석 (현재 글)
반응형
'빅데이터 플랫폼 & 아키텍처' 카테고리의 다른 글
| Kafka Consumer Lag 실전 대응 — 원인 진단·리밸런싱·처리량 튜닝 (0) | 2026.07.26 |
|---|---|
| 9편. 금융권 실사용 예시 ① 신용평가 / 여신 리스크 모델링 (0) | 2025.12.01 |
| 8편. 데이터 적재 파이프라인 구축 – Sqoop/Oozie/Spark Batch 실전 (0) | 2025.12.01 |
| 7편. 금융권 하둡 클러스터 운영 체계 – 내부망·보안·권한 관리 완전 가이드 (0) | 2025.11.28 |
| 6편. Hadoop + Kafka 기반 실시간 분석 아키텍처 – End-to-End 구현 가이드 (0) | 2025.11.28 |