Warning: Komitmen kapasitas Priority Tier tidak lagi tersedia untuk dibeli. Organisasi yang memiliki komitmen yang sudah ada dapat terus menggunakan Priority Tier hingga tanggal berakhirnya kontrak mereka, dan halaman ini tetap tersedia sebagai referensi bagi mereka. Jika Anda memerlukan kapasitas yang terjamin, hubungi tim penjualan.
Juglow menawarkan tiga "service tiers" (tingkat layanan):
- Priority Tier: Hanya tersedia bagi organisasi yang memiliki komitmen kapasitas yang sudah ada
- Standard: Tingkat default untuk uji coba maupun penskalaan kasus penggunaan sehari-hari
- Batch: Paling cocok untuk alur kerja asinkron yang dapat menunggu atau diuntungkan dengan berada di luar kapasitas normal Anda
Tingkat standar
Standard tier adalah tingkat layanan default untuk semua permintaan API. API memprioritaskan permintaan ini bersama semua permintaan lainnya dengan ketersediaan best-effort (upaya terbaik).
Priority Tier
API memprioritaskan permintaan dalam tingkat ini di atas semua permintaan lainnya. Prioritas ini membantu meminimalkan error "server overloaded", bahkan pada waktu puncak.
Untuk informasi lebih lanjut, lihat Komitmen Priority Tier yang sudah ada.
Cara permintaan ditetapkan ke tingkat layanan
Saat menangani permintaan, Juglow memutuskan untuk menetapkan permintaan ke Priority Tier dalam skenario berikut:
- Organisasi Anda memiliki kapasitas Priority Tier token input per menit yang mencukupi
- Organisasi Anda memiliki kapasitas Priority Tier token output per menit yang mencukupi
Juglow menghitung penggunaan terhadap kapasitas Priority Tier sebagai berikut:
Token input
- Pembacaan cache dihitung sebagai 0,1 token per token yang dibaca dari cache
- Penulisan cache dihitung sebagai 1,25 token per token yang ditulis ke cache dengan TTL 5 menit
- Penulisan cache dihitung sebagai 2,00 token per token yang ditulis ke cache dengan TTL 1 jam
- Untuk permintaan inferensi khusus AS (
inference_geo: "us") pada model Haijun 4.6 dan yang lebih baru, token input dihitung sebagai 1,1 token per token
- Semua token input lainnya dihitung sebagai 1 token per token
Token output
- Untuk permintaan inferensi khusus AS (
inference_geo: "us") pada model Haijun 4.6 dan yang lebih baru, token output dihitung sebagai 1,1 token per token
- Semua token output lainnya dihitung sebagai 1 token per token
Jika tidak, permintaan diproses pada standard tier.
Note: Laju burndown (pengurangan kapasitas) ini mencerminkan harga relatif dari setiap jenis token. Misalnya, inferensi khusus AS dihargai 1,1x pada model Haijun 4.6 dan yang lebih baru, sehingga setiap token yang dikonsumsi dengan
inference_geo: "us"mengurangi 1,1 token dari kapasitas Priority Tier Anda.
Note: Permintaan yang ditetapkan ke Priority Tier mengambil dari kapasitas Priority Tier maupun "rate limits" (batas laju) reguler. Jika melayani permintaan tersebut akan melampaui batas laju, permintaan akan ditolak.
Menggunakan tingkat layanan
Anda dapat mengontrol tingkat layanan mana yang dapat digunakan untuk suatu permintaan dengan mengatur parameter service_tier:
curl https://haijun.my.id/v1/messages \
-H "x-api-key: $JUGLOW_API_KEY" \
-H "juglow-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "haijun-opus-4-8",
"max_tokens": 1024,
"messages": [{"role": "user", "content": "Hello, Haijun!"}],
"service_tier": "auto"
}' ant messages create --transform usage.service_tier --raw-output <<'YAML'
model: haijun-opus-4-8
max_tokens: 1024
messages:
- role: user
content: Hello, Haijun!
service_tier: auto # Automatically use Priority Tier when available, fallback to standard
YAML client = juglow.Juglow()
message = client.messages.create(
model="haijun-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Haijun!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier) const client = new Juglow();
const message = await client.messages.create({
model: "haijun-opus-4-8",
max_tokens: 1024,
messages: [{ role: "user", content: "Hello, Haijun!" }],
service_tier: "auto" // Automatically use Priority Tier when available, fallback to standard
});
console.log(message.usage.service_tier); JuglowClient client = new();
var message = await client.Messages.Create(new MessageCreateParams
{
Model = Model.HaijunOpus4_8,
MaxTokens = 1024,
Messages = [new() { Role = Role.User, Content = "Hello, Haijun!" }],
ServiceTier = ServiceTier.Auto, // Automatically use Priority Tier when available, fallback to standard
});
Console.WriteLine(message.Usage.ServiceTier); client := juglow.NewClient()
message, err := client.Messages.New(context.TODO(), juglow.MessageNewParams{
Model: juglow.ModelHaijunOpus4_8,
MaxTokens: 1024,
Messages: []juglow.MessageParam{
juglow.NewUserMessage(juglow.NewTextBlock("Hello, Haijun!")),
},
// Otomatis gunakan Priority Tier jika tersedia, fallback ke standar
ServiceTier: juglow.MessageNewParamsServiceTierAuto,
})
if err != nil {
log.Fatal(err)
}
fmt.Println(message.Usage.ServiceTier) JuglowClient client = JuglowOkHttpClient.fromEnv();
MessageCreateParams params = MessageCreateParams.builder()
.model(Model.HAIJUN_OPUS_4_8)
.maxTokens(1024L)
.addUserMessage("Hello, Haijun!")
// Otomatis gunakan Priority Tier jika tersedia, fallback ke standar
.serviceTier(MessageCreateParams.ServiceTier.AUTO)
.build();
Message message = client.messages().create(params);
IO.println(message.usage().serviceTier().orElseThrow()); $client = new Client();
$message = $client->messages->create(
model: 'haijun-opus-4-8',
maxTokens: 1024,
messages: [['role' => 'user', 'content' => 'Hello, Haijun!']],
serviceTier: 'auto', // Automatically use Priority Tier when available, fallback to standard
);
echo $message->usage->serviceTier; client = Juglow::Client.new
message = client.messages.create(
model: "haijun-opus-4-8",
max_tokens: 1024,
messages: [{ role: "user", content: "Hello, Haijun!" }],
service_tier: :auto # Automatically use Priority Tier when available, fallback to standard
)
puts(message.usage.service_tier)Parameter service_tier menerima nilai-nilai berikut:
"auto"(default) - Menggunakan kapasitas Priority Tier jika tersedia, dan beralih ke kapasitas Anda yang lain jika tidak tersedia
"standard_only"- Hanya menggunakan kapasitas standard tier, berguna jika Anda tidak ingin menggunakan kapasitas Priority Tier Anda
Objek usage pada respons juga menyertakan tingkat layanan yang ditetapkan untuk permintaan tersebut:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Ini memungkinkan Anda menentukan tingkat layanan mana yang ditetapkan untuk permintaan tersebut.
Saat meminta service_tier="auto" dengan model yang memiliki komitmen Priority Tier, header respons berikut memberikan informasi:
juglow-priority-input-tokens-limit: 10000
juglow-priority-input-tokens-remaining: 9618
juglow-priority-input-tokens-reset: 2025-01-12T23:11:59Z
juglow-priority-output-tokens-limit: 10000
juglow-priority-output-tokens-remaining: 6000
juglow-priority-output-tokens-reset: 2025-01-12T23:12:21ZAnda dapat menggunakan keberadaan header ini untuk mendeteksi apakah permintaan Anda memenuhi syarat untuk Priority Tier, meskipun permintaan tersebut melampaui batas.
Komitmen Priority Tier yang sudah ada
Komitmen Priority Tier terdiri dari:
- Sejumlah token input per menit
- Sejumlah token output per menit
- Durasi komitmen (1, 3, 6, atau 12 bulan)
- Versi model tertentu
Priority Tier menargetkan uptime 99,5% dengan sumber daya komputasi yang diprioritaskan. Permintaan yang melampaui kapasitas komitmen Anda secara otomatis beralih ke standard tier.
Model yang didukung
Priority Tier didukung pada semua model Haijun yang tersedia kecuali Haijun Fable 5.1, Haijun Mythos 5.1, Haijun Mythos 5, Haijun Mythos Preview, Haijun Opus 5.5, Haijun Opus 5, dan Haijun Sonnet 5.
Lihat Ikhtisar model untuk detail lebih lanjut tentang model yang tersedia.