본문 바로가기

반응형

전체 글

(413)
『그냥 Postgres를 쓰세요!』 리뷰 — 데이터베이스를 하나 더 붙이기 전에 던져야 할 질문 ※ 이 글은 제이펍 서평단 활동을 통해 도서를 제공받아 읽고 작성한 리뷰입니다.아키텍처 그림에 박스가 하나씩 늘어날 때시스템 구축 프로젝트를 하다 보면 아키텍처 그림에 박스가 하나씩 늘어나는 순간이 있습니다. 업무 데이터는 관계형 데이터베이스에, 검색은 검색 엔진에, 임베딩은 벡터 데이터베이스에, 비동기 처리는 메시지 브로커에, 센서나 로그 데이터는 시계열 데이터베이스에 넣는 식입니다. 각각의 선택에는 이유가 있지만, 박스가 하나 늘 때마다 설치와 이중화, 백업, 모니터링, 계정과 권한 관리, 보안 점검, 데이터 동기화, 그리고 그것을 운영할 사람까지 함께 늘어납니다. 특히 망 분리가 적용된 공공·금융 환경에서는 새로운 제품 하나를 반입하고 검토받는 과정 자체가 일정에 영향을 줍니다.『그냥 Postgre..
Kafka Consumer Lag 완전정리 — 확인 방법·원인 진단·리밸런싱·처리량 튜닝 "Lag이 10만인데 괜찮은 건가요?" Kafka를 운영하면 반드시 이 질문 앞에 섭니다. 답부터 말하면 건수만 보고는 알 수 없습니다. 초당 10만 건을 처리하는 그룹의 lag 10만은 1초짜리이고, 초당 100건을 처리하는 그룹의 lag 10만은 17분짜리입니다. 이 글은 lag을 제대로 읽는 법에서 시작해, 원인을 여섯 갈래로 좁히는 진단 순서, 그리고 파라미터·파티션·리밸런싱이라는 세 개의 레버를 실전 순서대로 정리합니다.핵심 요약Lag = LOG-END-OFFSET − CURRENT-OFFSET. 브로커에 쌓인 마지막 오프셋과 커밋된 오프셋의 차이입니다. "처리한 위치"가 아니라 "커밋한 위치"라는 점이 함정입니다.건수 lag보다 시간 lag을 보십시오. 알림 임계값을 건수로 잡으면 트래픽이 바..
vLLM 양자화 완전정리 — GGUF·AWQ·GPTQ·W4A16·FP8 선택 기준 "GGUF로 받아서 vLLM에 올리면 되나요?" 로컬 LLM 서버를 세우다 보면 반드시 이 질문에 도착합니다. 답부터 말하면 vLLM에서는 GGUF가 1순위가 아닙니다. 공식 문서가 스스로 "매우 실험적이고 최적화가 덜 됐다"고 적어두고 있고, 아예 별도 플러그인으로 분리됐습니다. 그럼 무엇을 써야 하나. 이 글은 양자화 표기법을 읽는 법부터 GPU 세대별 정답, 실측 수치, KV 캐시라는 별도의 레버까지 실전 결정 순서대로 정리합니다.핵심 요약목적을 먼저 정하십시오. 메모리를 줄이려는 것과 처리량을 올리려는 것은 다른 스킴으로 갑니다.W4A16 같은 표기는 가중치(W) 4비트 / 활성값(A) 16비트라는 뜻입니다. 이것만 읽을 줄 알면 절반은 끝납니다.GGUF는 vLLM에서 "highly experim..