본문 바로가기

빅데이터 플랫폼 & 아키텍처

10편. 금융권 실사용 예시 ② FDS(이상거래탐지) 로그 분석

반응형

🟧 10편. 금융권 실사용 예시 ② FDS(이상거래탐지) 로그 분석

FDS(Fraud Detection System)는 하둡의 가장 강력한 활용 분야다.
로그 규모가 매우 크고, 실시간 분석에 Hive + Spark이 자주 사용된다.


■ 1) FDS 데이터 구조

로그 종류: 결제로그, 접속로그, API 호출로그, 단말기 정보, IP 정보
일일 데이터: 수억 건

■ 2) Kafka → Hadoop 적재 구조

Kafka
   ▼
Flume / Spark Streaming
   ▼
HDFS Raw
   ▼
Hive Partitioned Table

■ 3) FDS 실시간 의심 거래 탐지 Spark 코드 예시

txn = spark.sql("""
    SELECT cust_id, amount, country, ip, device_id, dt
    FROM fds_txn
    WHERE dt = '2024-01-01'
""")

susp = txn.filter(
    (txn.amount > 500000) &
    (txn.country != 'KR') &
    (txn.ip.startswith('10.') == False)
)

■ 4) FDS 튜닝 포인트

  • Partition key를 datetime으로 설정
  • Spark Executor 메모리를 크게 할당
  • Skew 데이터(특정 고객 몰림) 분산 처리
  • Parquet + Snappy 압축 필수

 실전 TIP 3개

① FDS는 ETL 실패가 곧 장애다 → 적재 모니터링 반드시 자동화
→ Slack 또는 사내 메신저 알림 필요.

② Data Skew는 bucket table로 해결 가능
→ 특정 고객 트래픽이 몰릴 때 특히 효과적.

③ 실시간성 요구가 높으면 Kafka → Spark Streaming → Redis 캐시 조합이 가장 안정적
→ 금융권에서 가장 널리 쓰는 구조.


 

반응형