100개 이상의 LLM을 하나의 OpenAI 형식으로 호출하는 단일 진입점
여러 AI 서비스의 API 키와 요청 형식을 각각 관리하던 복잡함에서 벗어나, 하나의 주소로 모든 모델을 호출하는 장면을 상상해 보세요. LiteLLM은 다양한 LLM 제공업체를 OpenAI 호환 형식으로 통일하는 오픈소스 AI 게이트웨이입니다. Python SDK로 직접 코드를 쓰거나, 팀 전체가 공유하는 프록시 서버로 배포할 수 있습니다.
Rust 코어와 Python SDK의 결합
이 저장소는 Rust로 작성된 코어와 Python SDK를 함께 제공합니다. Rust 코어가 성능을 담당하고, Python SDK가 개발자에게 친숙한 인터페이스를 줍니다. litellm 패키지는 프록시 서버, CLI, 대시보드 등 모든 기능을 포함하며, litellm-core는 SDK만 필요한 환경에서 가볍게 사용할 수 있는 독립 배포판입니다. 두 패키지는 일부 Python 파일을 공유하므로 같은 환경에 함께 설치하면 안 됩니다. Rust 빌드 도체인 uv와 Git이 설치되어 있어야 코어 분포를 직접 빌드할 수 있습니다.
게이트웨이와 SDK의 역할 구분
사용 목적에 따라 두 가지 모드로 나뉩니다. Python SDK는 개발자가 자신의 코드베이스에 직접 통합하여 여러 LLM을 호출할 때 사용합니다. 이 경우 라우터가 재시도 및 폴백 로직을 처리하고, OpenAI 호환 오류를 반환합니다. AI 게이트웨이(프록시 서버)는 조직이나 팀이 중앙 집중식 서비스를 구축할 때 적합합니다. 가상 키를 통한 접근 제어, 프로젝트별 비용 추적, 가드레일, 로드 밸런싱, 관리 대시보드가 기본으로 제공됩니다. Netflix와 같은 기업들이 이 오픈소스를 채택하고 있습니다.
MCP와 에이전트 프로토콜 지원
LiteLLM은 MCP(Model Context Protocol) 브릿지와 A2A(Agent-to-Agent) 프로토콜을 지원합니다. MCP 서버를 게이트웨이에 등록하면, /chat/completions 엔드포인트를 통해 MCP 도구를 OpenAI 형식으로 호출할 수 있습니다. Cursor IDE와 같은 도구에서도 MCP 서버로 직접 연결할 수 있습니다. 에이전트 하네스 기능은 Claude Code, Codex, OpenCode, DeepAgents와 같은 에이전트를 실행할 때, 모든 모델 호출이 AI 게이트웨이를 통해 지나가도록 설정할 수 있습니다. 이를 통해 에이전트의 활동이 게이트웨이에 기록되고 추적됩니다.
클라우드 배포와 보안 검증
AWS와 GCP에 배포하기 위한 Terraform 모듈이 공개 레지스트리에 있습니다. AWS는 ECS Fargate, Aurora, ElastiCache, ALB를 사용하고, GCP는 Cloud Run, Cloud SQL, Memorystore, HTTPS LB를 사용합니다. 두 스택 모두 게이트웨이, 백엔드, UI를 독립적인 서비스로 분리하고, 관리형 Postgres와 Redis, 객체 저장소를 포함합니다. Docker 이미지는 cosign으로 서명되며, 특정 커밋 해시나 릴리스 태그를 이용해 서명 키를 검증할 수 있습니다. 안정성 테스트를 거친 -stable 태그의 Docker 이미지를 프로덕션에 사용하는 것이 권장됩니다.
성능 수치와 도입 전 확인 사항
이는 벤치마크 결과이며, 실제 환경에서는 네트워크와 모델 응답 시간에 따라 달라질 수 있습니다. 지원 목록은 광범위하지만, 특정 엔드포인트(예: /audio, /images)는 제공업체마다 지원 여부가 다릅니다. 기업용 라이선스는 SSO, 전문 지원, 커스텀 SLA를 포함하며, 오픈소스 버전과 기능 차이가 있을 수 있습니다.