doksam.com
만들어 온 것들

셀프호스팅 LLM 인프라

자체 GPU 서버에서 오픈소스 모델을 서빙하는 내부 전용 LLM

상태
운영 중
쓴 기술
오픈소스 LLM · GPU 2장 · OpenAI 호환 API · 컨테이너
분류
GPU 서빙 · 오픈소스 LLM · 프라이버시

어떤 상황이었나

외부 상용 API 로 보낼 수 없는 자료를 다뤄야 하는데, 그 제약 때문에 AI 를 아예 못 쓰는 상태였습니다.

만든 것

  • 24GB GPU 2장 서버의 모델 서빙 구성
  • OpenAI 호환 내부 API
  • 임베딩 모델 별도 서빙
  • 내부 서비스 연결

어떻게 돌아가나

모델 적재내부 API 노출서비스 호출응답

내부 네트워크에서만 접근되도록 열어 두고, 다른 자체 서비스들이 이 API 를 씁니다.

하지 않는 것

  • 외부 API 를 호출하지 않습니다.
  • 상용 최상위 모델과 같은 품질을 보장하지는 않습니다.

의뢰처와 내부 구성은 공개하지 않습니다. 이 글은 일반화한 설명입니다.

비슷한 걸 만들어야 한다면

어떤 상황인지 알려주시면 비슷한 구성부터 정리해서 회신드립니다.

문의하기