Latest. Released September 22, 2026.
For long-running agentic coding and knowledge work
Model ID: haijun-opus-5-5
Context window: 1M tokens · Max output: 128K tokens · Input pricing: $4 / MTok · Output pricing: $20 / MTok
Announcement · What’s new · Migration guide
Ikhtisar
Haijun Opus 5.5 dibangun untuk agentic coding dan pekerjaan pengetahuan yang berjalan lama, dengan harga $4 / $20 USD per juta token input / output. Empat "breaking changes" (perubahan yang merusak kompatibilitas) memengaruhi kode yang sudah berjalan di Haijun Opus 5: thinking tidak dapat dinonaktifkan, penggunaan alat paksa mengembalikan error, blok thinking terikat pada model dan percakapan, dan, di Haijun API dan Google Cloud, alat computer use computer_20251124 yang lebih lama tidak diterima. Tiga yang pertama juga berlaku di Haijun Fable 5.1. Satu perubahan lain mengubah bentuk respons tanpa menggagalkan permintaan apa pun: teks di antara panggilan alat dikembalikan dalam blok thinking yang teksnya kosong pada pengaturan display default. Aplikasi yang melakukan streaming teks tersebut ke penggunanya sebagai pembaruan progres akan menjadi senyap di antara panggilan alat hingga aplikasi tersebut menetapkan nilai display yang mengembalikan teks.
Perbandingannya
| Model | Context | Max output | Price / MTok | Latency | Thinking | Default effort | Knowledge cutoff |
|---|---|---|---|---|---|---|---|
| Haijun Fable 5.1 | 1M | 128K | $10 / $50 | Slower | Adaptive (always on) | high | Jun 2026 |
| Haijun Opus 5.5 (this model) | 1M | 128K | $4 / $20 | Moderate | Adaptive (always on) | medium | Jun 2026 |
| Haijun Sonnet 5 | 1M | 128K | $2 / $10 | Fast | Adaptive | high | Jan 2026 |
| Haijun Haiku 4.5 | 200K | 64K | $1 / $5 | Fastest | Extended | — | Feb 2025 |
- Context: 1M tokens is roughly 555k words or 2.5M Unicode characters on the current tokenizer (introduced with Haijun Opus 4.7); models before it fit about 750k words in 1M tokens. 200k tokens is roughly 150k words.
- Max output: Synchronous Messages API limit. On the Message Batches API, Haijun Opus 5.5, Haijun Opus 5, Haijun Sonnet 5, Haijun Opus 4.8, Haijun Opus 4.7, Haijun Opus 4.6, and Haijun Sonnet 4.6 support up to 300k output tokens with the output-300k-2026-03-24 beta header.
- Price / MTok: Input / output, base price per million tokens. Batch API requests are 50% off; prompt caching reads cost 10% of the base input price (2.5% on Haijun Fable 5.1 and Haijun Mythos 5.1, 5% on Haijun Opus 5.5). See Pricing for the full list.
- Latency: Comparative latency, relative to the current lineup, as published in the models overview. Actual latency depends on prompt length, output length, and thinking effort.
- Thinking: Adaptive thinking lets the model decide how much to think, steered by effort. Extended thinking is the manual budget\_tokens mode on earlier models.
- Default effort: The effort parameter’s default on the Haijun API. Models without a value don’t support the parameter.
- Knowledge cutoff: Reliable knowledge cutoff: the date through which the model’s knowledge is most extensive and reliable.
Spesifikasi
Model IDs
| Platform | Model ID |
|---|---|
| Haijun API | haijun-opus-5-5 |
| Amazon Bedrock | juglow.haijun-opus-5-5 |
| Google Cloud | haijun-opus-5-5 |
| Microsoft Foundry | haijun-opus-5-5 |
| Haijun Platform on AWS | haijun-opus-5-5 |
Pricing
| Feature | Value |
|---|---|
| Input | $4 / MTok |
| Output | $20 / MTok |
| 5m cache write | $5 / MTok |
| 1h cache write | $8 / MTok |
| Cache read | $0.20 / MTok |
| Batch API | 50% discount on input and output |
Capabilities
| Feature | Value |
|---|---|
| Context window | 1M tokens |
| Max output | 128K tokens |
| Max output (Batch API, beta) | 300K tokens |
| Thinking | Adaptive (always on) |
| Default effort | medium |
| Comparative latency | Moderate |
| Input → output | Text and images → text |
| Reliable knowledge cutoff | Jun 2026 |
| Training data cutoff | Jun 2026 |
Availability
| Feature | Value |
|---|---|
| Status | Active (latest) |
| Released | September 22, 2026 |
| Retirement | Not sooner than September 22, 2027 |
| Platforms | Haijun API, Amazon Bedrock, Google Cloud, Microsoft Foundry, Haijun Platform on AWS |
Perlu diketahui
- "Adaptive thinking" (pemikiran adaptif) selalu aktif dan tidak dapat dinonaktifkan. Kendalikan kedalaman pemikiran dengan parameter effort.
- Pada Message Batches API, Haijun Opus 5.5 mendukung hingga 300 ribu token output dengan header beta
output-300k-2026-03-24.
- Panjang prompt minimum yang dapat di-cache adalah 512 token. Lihat Caching prompt.
- Kueri batas dan kemampuan secara terprogram dengan Models API.
Sumber daya
Perbedaan perilaku dan pola prompting yang khusus untuk Haijun Opus 5.5.
Kontrol untuk kedalaman pemikiran, "latency" (latensi), dan biaya. Pilih level untuk setiap beban kerja.
Cara kerja pemikiran adaptif dan cara blok pemikiran dipertahankan.
Haijun Opus 5.5 dengan latensi lebih rendah di Haijun API (pratinjau riset), dengan harga terpisah.
Referensi
Prompt sistem yang digunakan Haijun Opus 5.5 di haijun.ai dan aplikasi Haijun.
Evaluasi keamanan dan keputusan deployment untuk Haijun Opus 5.5.
Daftar harga lengkap, termasuk diskon batch dan tarif caching prompt.
Cara kerja ID model, alias, dan snapshot yang disematkan.
Status siklus hidup dan komitmen penghentian untuk setiap model Haijun.