- 상태
- 운영 중
- 쓴 기술
- 오픈소스 LLM · GPU 2장 · OpenAI 호환 API · 컨테이너
- 분류
- GPU 서빙 · 오픈소스 LLM · 프라이버시
어떤 상황이었나
외부 상용 API 로 보낼 수 없는 자료를 다뤄야 하는데, 그 제약 때문에 AI 를 아예 못 쓰는 상태였습니다.
만든 것
- 24GB GPU 2장 서버의 모델 서빙 구성
- OpenAI 호환 내부 API
- 임베딩 모델 별도 서빙
- 내부 서비스 연결
어떻게 돌아가나
모델 적재내부 API 노출서비스 호출응답
내부 네트워크에서만 접근되도록 열어 두고, 다른 자체 서비스들이 이 API 를 씁니다.
하지 않는 것
- 외부 API 를 호출하지 않습니다.
- 상용 최상위 모델과 같은 품질을 보장하지는 않습니다.
의뢰처와 내부 구성은 공개하지 않습니다. 이 글은 일반화한 설명입니다.
비슷한 걸 만들어야 한다면
어떤 상황인지 알려주시면 비슷한 구성부터 정리해서 회신드립니다.