Haijun Platform Docs
EN

"Compaction" (pemadatan) menggantikan giliran-giliran lama dalam percakapan dengan ringkasan yang ditulis Haijun di server, sehingga Anda tidak memerlukan kode peringkasan sendiri. Compaction menjaga percakapan panjang atau tugas agen tetap berada di dalam "context window" (jendela konteks), dan menjaga konteks aktif tetap kecil, karena kualitas respons menurun seiring bertambah panjangnya percakapan.

Jika Anda ingin melewati ikhtisar ini, mulailah dengan Compaction sesuai permintaan untuk menambahkan compaction ke aplikasi Anda. Meskipun fitur tersebut dan Compaction pada ambang batas token sama-sama masih dalam tahap beta, Compaction sesuai permintaan mencakup lebih banyak kasus penggunaan umum. Untuk menghapus hasil alat lama atau blok thinking lama berdasarkan aturan alih-alih meringkasnya, lihat Pengeditan konteks.

Pilih cara melakukan compaction

Gunakan compaction sesuai permintaan di mana pun fitur tersebut tersedia.

Compaction sesuai permintaanCompaction pada ambang batas tokenPeringkas Anda sendiri (Lakukan compaction di sisi klien)
Siapa yang menentukan kapanAnda, dengan mengirim permintaanAPI, ketika token input mencapai pemicu yang Anda tetapkanAnda
Kode yang Anda tulisSebuah loop compaction yang meminta ringkasan dan menukarkannya ke dalam percakapanSatu parameter pada permintaan biasa AndaPanggilan peringkasan, prompt-nya, dan penulisan ulang riwayat
Apa yang Anda kirim kembali setelahnyaBlok yang dikembalikan, di posisi pertama dalam messages, menggantikan pesan-pesan yang diringkasnyaRespons, ditambahkan seperti biasa. API membuang apa pun yang ada sebelum blok tersebutRingkasan Anda, sebagai pesan Anda sendiri
Giliran terbaru tetap kata demi kataYa: Compaction yang mempertahankan giliran terbaruYa, dengan berhenti sejenak setelah compaction dan memasukkannya kembaliYa
Berjalan di latar belakangYa: Compaction di latar belakangTidak: compaction berjalan di dalam permintaan yang mencapai ambang batasYa, dalam kode Anda sendiri
Giliran yang dipertahankan tetap menyimpan thinking-nya, pada model dengan preserved thinking (pemikiran yang dipertahankan)Ya, dengan kondisi yang dijelaskan di Compaction dan pemikiran yang dipertahankanTidak: pada Haijun Fable 5.1 dan Haijun Opus 5.5, hapus atau buang thinking pada giliran yang Anda masukkan kembali (lihat contoh compaction ambang batas)Tidak: thinking tersebut gagal dalam pemeriksaan
Header beta, parameter, dan platformcompact-2026-09-04 dan parameter tingkat atas compaction. Platform: lihat daftar Kompatibilitas sesuai permintaanLihat daftar Kompatibilitas ambang batas dan Penggunaan dasarTidak ada. Berjalan di kode Anda
Pilih ketikaAplikasi Anda perlu mengontrol kapan compaction terjadi, tidak dapat berhenti sejenak saat ringkasan ditulis, atau harus mempertahankan giliran terbaru beserta thinking-nyaAnda ingin API mengelola konteks di dalam permintaan biasaAnda sudah menjalankan peringkas sendiri dan peringkas tersebut mengganti seluruh riwayat dengan ringkasan

Opsi compaction sesuai permintaan

Compaction sesuai permintaan menunjukkan loop yang meringkas seluruh percakapan sementara aplikasi Anda menunggu. Dua halaman pertama dalam daftar ini mengubah cara loop tersebut berjalan, dan Anda dapat menggabungkan keduanya. Halaman ketiga berlaku jika Anda mengirim kembali blok thinking dan melakukan salah satu dari keduanya.

  • Compaction di latar belakang: ketika percakapan tidak dapat berhenti sejenak untuk menunggu ringkasan. Permintaan berjalan sementara pekerjaan berlanjut, dan Anda menukarkan blok tersebut ke dalam percakapan saat blok itu tiba.
  • Compaction dan pemikiran yang dipertahankan: jika Anda mengirim kembali blok thinking pada model dengan preserved thinking dan Anda mempertahankan giliran terbaru atau melakukan compaction di latar belakang. Jika tidak, lewati halaman ini.

Temukan topik-topik berikut di halaman lain:

Compaction ambang batas memiliki halamannya sendiri: Compaction pada ambang batas token.

On this page
Pilih cara melakukan compactionOpsi compaction sesuai permintaan