Bedrock melalui LiteLLM
Gunakan halaman ini ketika organisasi Anda merutekan Codex ke Amazon Bedrock melalui LiteLLM. Jika gateway LiteLLM sudah tersedia, hubungkan Codex terlebih dahulu. Terapkan LiteLLM hanya ketika organisasi Anda membutuhkan gateway baru.
Produk gateway lain mengikuti persyaratan gateway dan alur koneksi Codex yang sama.
Hubungkan ke gateway yang ada
Dapatkan nilai berikut dari administrator gateway Anda:
- URL dasar HTTPS, seperti
https://gateway.example.com/v1. - Alias model yang dirutekan LiteLLM ke model Bedrock yang disetujui.
- ID penyedia yang akan digunakan dalam konfigurasi Codex.
- Kredensial gateway dengan cakupan terbatas atau helper autentikasi yang mengembalikannya.
- Katalog model apa pun yang didistribusikan bersama konfigurasi organisasi Anda.
Kemudian selesaikan koneksi dalam urutan berikut:
- Minta tim gateway Anda memastikan bahwa gateway melayani
POST /v1/responses, mengalirkan respons, mempertahankan giliran lanjutan dan pemanggilan alat, serta merutekan alias yang disetujui. Lihat Kompatibilitas gateway. - Ikuti Hubungkan ke gateway untuk mengonfigurasi penyedia, model, dan kredensial.
- Verifikasi penyedia dan alias yang aktif, kirim prompt singkat
gateway-okdari panduan koneksi, dan pastikan catatan LiteLLM menunjukkan pengguna dan alias yang diharapkan. - Untuk distribusi ke seluruh organisasi, lanjutkan dengan Terapkan Codex melalui gateway.
Kredensial gateway Anda mengautentikasi Anda ke LiteLLM. Gateway mengelola kredensial Bedrock-nya sendiri; Anda tidak perlu menyalin kredensial tersebut ke workstation Anda.
Siapkan gateway
Gunakan bagian ini hanya ketika Anda perlu membuat gateway LiteLLM sebelum menghubungkan Codex.
Sebelum menerapkan
Pastikan Anda memiliki:
- Izin untuk menerapkan arsitektur LiteLLM yang disetujui di lingkungan AWS Anda.
- Akses Bedrock ke model atau profil inferensi yang akan Anda rutekan.
- Image LiteLLM dan pola penerapan yang telah ditinjau.
- Nama host HTTPS dan sertifikat yang tepercaya.
- Rentang jaringan klien yang dibatasi.
Untuk contoh Runtime di bawah, identitas AWS gateway memerlukan bedrock:InvokeModel untuk profil inferensi yang dipilih dan proyek default akun. Lihat petunjuk penyiapan GPT-6 Sol dari AWS untuk izin yang diperlukan.
Arsitektur
Penerapan ini menempatkan LiteLLM di antara Codex dan Bedrock, dengan HTTPS pada batas klien. Penyeimbang beban dan LiteLLM berada di dalam batas gateway organisasi Anda; kredensial penyedia tetap berada di gateway.
Batasi akses masuk hanya untuk klien yang disetujui, pertahankan port database dan cache tetap privat, dan berikan hanya izin Bedrock yang diperlukan kepada gateway. Kunci image yang diterapkan berdasarkan digest agar mulai ulang tidak mengubah implementasi secara diam-diam.
Prompt, kutipan sumber, dan hasil alat melewati gateway dan dapat masuk ke lognya. Tentukan retensi, akses, dan penyamaran data sebelum mengaktifkan pencatatan log permintaan. MCP server dan plugin memiliki koneksi serta autentikasi terpisah; konfigurasi gateway ini tidak mengonfigurasinya.
Tahap pemeriksaan penerapan
Selesaikan tahap pemeriksaan berikut secara berurutan sebelum menyerahkan gateway kepada pengembang:
| Tahap pemeriksaan | Hasil |
|---|---|
| Terapkan proxy dengan dependensi database dan cache privat. | URL dasar HTTPS yang stabil dengan akhiran /v1, dengan autentikasi Bedrock yang dikelola gateway. |
| Konfigurasikan rute model dan katalog klien yang sesuai. | Alias stabil yang digunakan oleh Codex dan dipetakan ke target Bedrock yang dituju. |
| Verifikasi dukungan Responses. | Respons POST /v1/responses yang dialirkan dan diakhiri dengan response.completed. |
| Terbitkan kredensial pengujian. | Kunci virtual per pengguna yang dibatasi pada alias tersebut, dengan masa berlaku, anggaran, dan batas laju. |
| Hubungkan satu pengembang. | Konfigurasi penyedia Codex dan prompt singkat yang telah diverifikasi melalui gateway. |
Bagian-bagian di bawah membahas setiap tahap pemeriksaan. Untuk peluncuran produksi, uji juga giliran lanjutan, alat, dan pencabutan kredensial.
Pilih rute Bedrock
Rute upstream LiteLLM menentukan endpoint Bedrock, pengidentifikasi model, dan metode autentikasi. Kelola pilihan-pilihan ini sebagai satu kesatuan saat Anda menerapkan atau mengubah gateway.
Gunakan Bedrock Runtime untuk konfigurasi baru. Contoh di bawah menggunakan endpoint Responses yang kompatibel dengan OpenAI.
Lihat integrasi Bedrock Mantle dari LiteLLM untuk rute alternatif.
Untuk contoh penerapan AWS, gunakan referensi LiteLLM di ECS yang versinya dikunci. Implementasi tersebut menggunakan Bedrock Runtime dan menyegarkan autentikasi dari peran tugas ECS. Ikuti langkah penerapan dan autentikasinya secara bersamaan, lalu tinjau persyaratan produksinya terhadap kebijakan jaringan, TLS, pencatatan log, dan retensi sumber daya Anda.
Apa pun rute yang Anda pilih, verifikasi kombinasi versi gateway, endpoint upstream, dan model yang diterapkan terhadap Kompatibilitas gateway. Kemunculan model upstream dalam daftar model gateway tidak membuktikan bahwa perilaku streaming, kelanjutan percakapan, dan alatnya berfungsi dengan Codex.
Konfigurasikan rute model Runtime
Petakan alias stabil yang digunakan oleh Codex ke model upstream yang disetujui. Pastikan akses di akun dan Region AWS Anda sebelum menggunakan contoh Runtime ini.
model_list:
- model_name: company-coding-model
litellm_params:
model: openai/global.openai.gpt-6-sol
api_key: os.environ/AWS_BEARER_TOKEN_BEDROCK
api_base: https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1Sediakan API key Bedrock yang valid sebagai AWS_BEARER_TOKEN_BEDROCK melalui sistem pengelolaan rahasia Anda. Untuk kunci berumur pendek, terbitkan penggantinya sebelum kedaluwarsa, perbarui lingkungan proses gateway, lalu mulai ulang atau terapkan ulang worker yang menggunakannya. Sebagai gantinya, referensi ECS menyegarkan kredensial di dalam proses dari peran tugasnya; gunakan konfigurasi dan entrypoint-nya secara bersamaan.
Prefiks openai/ memilih adaptor LiteLLM yang kompatibel dengan OpenAI; api_base yang dikonfigurasi mengirim permintaan ke Bedrock Runtime. Profil inferensi Global dapat merutekan permintaan ke luar Region asal. Pilih profil dan Region yang memenuhi izin AWS serta persyaratan residensi data Anda, lalu ganti kedua nilai sesuai kebutuhan.
Klien mengirim company-coding-model; LiteLLM menggunakan rute upstream yang dikonfigurasi. Alias kustom ini memerlukan katalog klien yang sesuai sebagaimana dijelaskan berikutnya. Gateway generik tidak mewarisi penyesuaian metadata penyedia Bedrock bawaan.
Siapkan katalog klien
Untuk contoh GPT-6 Sol/Runtime ini dengan Codex 0.158.0, mulai dengan entri gpt-6-sol lengkap dari katalog model versi tersebut. Terapkan semua perubahan berikut pada entri itu:
| Field | Perubahan yang diperlukan |
|---|---|
slug |
Atur ke "company-coding-model", sesuai dengan alias LiteLLM. |
visibility |
Atur ke "list". |
availability_nux |
Atur ke null. |
upgrade |
Atur ke null. |
use_responses_lite |
Atur ke false. |
tool_mode |
Atur ke null. |
supported_reasoning_levels |
Hapus entri yang memiliki effort bernilai "ultra"; pertahankan entri lainnya. |
additional_speed_tiers |
Atur ke []. |
service_tiers |
Atur ke []. |
default_service_tier |
Atur ke null. |
web_search_tool_type |
Atur ke "text". |
multi_agent_version |
Atur ke "v1". |
supports_search_tool |
Atur ke false untuk Runtime. |
Pertahankan field lainnya, termasuk instruksi dan batas konteks model. Pertahankan entri yang telah diedit dalam array models tingkat teratas katalog. Perubahan ini mencerminkan penyesuaian metadata Bedrock dan pembatasan pencarian Runtime yang telah dirilis. Periksa kembali terhadap sumber yang sesuai saat mengubah versi klien atau model upstream.
Distribusikan file JSON lengkap dan konfigurasikan model_catalog_json dengan mengikuti Terapkan Codex melalui gateway. Pertahankan web_search = "disabled" dalam konfigurasi klien Runtime. Verifikasi katalog yang telah diedit melalui gateway sebelum mendistribusikannya kepada lebih banyak pengguna.
Verifikasi dukungan Responses
Sediakan POST /v1/responses pada endpoint HTTPS yang diakses klien. Konfigurasikan penyeimbang beban dan setiap reverse proxy untuk meneruskan peristiwa streaming tanpa buffering. Pertahankan giliran lanjutan dan hasil pemanggilan fungsi. Endpoint Chat Completions yang berfungsi saja tidak cukup untuk koneksi ini.
Selesaikan pemeriksaan dalam Kompatibilitas gateway sebelum mendistribusikan konfigurasi klien. Uji melalui nama host, kontrol jaringan, dan jalur autentikasi yang sama dengan yang akan digunakan pengguna Anda.
Terbitkan kredensial pengujian
Buat kunci virtual LiteLLM dengan cakupan terbatas untuk satu pengguna pengujian. Batasi pada alias yang disetujui dan konfigurasikan masa berlaku, batas laju, serta anggaran. Lihat dokumentasi kunci virtual LiteLLM untuk kontrol yang berlaku.
Distribusikan kunci melalui proses pengelolaan rahasia atau helper autentikasi Anda. Jangan berikan kunci administratif LiteLLM kepada pengguna atau menyematkan kredensial gateway dalam config.toml.
Verifikasi koneksi pengguna
Selesaikan pemeriksaan berikut sebelum memperluas akses:
- Pastikan sertifikat HTTPS cocok dengan nama host gateway dan layanan berjalan dengan baik.
- Hubungkan satu pengguna melalui Hubungkan ke gateway.
- Jalankan prompt singkat, satu giliran lanjutan, dan tugas alat hanya baca.
- Pastikan catatan gateway menunjukkan identitas, alias, dan rute upstream yang diharapkan tanpa mengekspos kredensial atau konten prompt yang sensitif.
- Uji kedaluwarsa atau pencabutan kredensial dan pastikan alias model yang tidak diizinkan ditolak.
Simpan versi image yang diterapkan, konfigurasi rute, dan hasil pengujian bersama catatan peluncuran Anda. Lanjutkan dengan Terapkan Codex melalui gateway untuk distribusi ke tim dan operasi berkelanjutan.
Atasi masalah koneksi
Gunakan lapisan yang gagal untuk mempersempit masalah:
| Gejala | Hal yang perlu diperiksa |
|---|---|
| HTTPS gagal sebelum inferensi | DNS, nama host sertifikat, kesehatan penyeimbang beban, dan jaringan klien yang diizinkan. |
Gateway mengembalikan 401 atau 403 |
Bedakan kredensial pengguna yang ditolak dari kegagalan autentikasi atau izin Bedrock upstream dengan menggunakan log gateway. |
| Model yang diminta tidak ditemukan | Pastikan alias yang diakses klien sama persis beserta pemetaannya ke model upstream atau profil inferensi. |
| Permintaan diblokir sebelum mencapai LiteLLM | Periksa log penyeimbang beban dan firewall aplikasi web, termasuk batas badan permintaan. Pertahankan kontrol keamanan Anda saat menguji permintaan Codex yang representatif. |
| Teks berfungsi, tetapi giliran tidak selesai | Periksa buffer streaming, batas waktu, peristiwa penutup, serta pemeriksaan tindak lanjut dan pemanggilan alat dalam Kompatibilitas gateway. |
| Permintaan upstream melewati batas waktu | Periksa ketersediaan model di Region asal, konfigurasi perutean, kuota, dan log gateway sebelum mengubah batas waktu. |
Uji ulang jalur pengguna yang sama setelah perbaikan. Pemeriksaan kesehatan gateway yang berhasil tidak memverifikasi permintaan inferensi terautentikasi atau giliran Codex yang lengkap.