Keuntungan:
- Keupayaan untuk memahami tiga tunjang kebolehmerhatian (metrik, log, surih) dan empat isyarat emas dan mempunyai kecerdasan buatan menjana pertanyaan PromQL, peraturan penggera dan papan pemuka
- Keupayaan untuk mengelakkan keletihan penggera dengan memastikan penggera berorientasikan tindakan dan pada tahap segera dan menguji ambang terhadap data sejarah sistem anda sendiri
- Keupayaan untuk mencegah privasi dan kebocoran rahsia dengan menutup kawasan sensitif sebelum memberikan log kepada kecerdasan buatan
Walaupun sistem mungkin kelihatan berfungsi, ia mungkin mati di dalam: memori perlahan-lahan terisi, masa tindak balas meningkat, kadar ralat meningkat. Satu-satunya cara untuk melihat ini adalah dengan sentiasa memantau sistem. Konsep yang lebih maju ialah kebolehmerhatian: keupayaan untuk memahami perkara yang berlaku di dalam sistem dengan melihat tanda luarannya. Terdapat tiga tiang pemerhatian, dan profesional DevOps menggunakan ketiga-tiga:
- Metrik: Nilai berangka yang diukur dari semasa ke semasa — penggunaan CPU, bilangan permintaan, masa tindak balas, kadar ralat. "Berapa harga?" menjawab soalan.
- Log: Rekod peristiwa teks yang dihasilkan oleh sistem—"pengguna log masuk", "sambungan pangkalan data hilang". "Apa sebenarnya yang berlaku?" menjawab soalan.
- Jejak: Laluan yang diikuti oleh permintaan semasa berpindah dari perkhidmatan ke perkhidmatan dalam sistem dan tempoh setiap langkah. “Di mana kelambatannya?” menjawab soalan.
Alat yang paling biasa: Prometheus untuk metrik, Grafana untuk visualisasi, Loki/ELK untuk log, Jaeger/OpenTelemetry untuk surih. AI sangat mahir dalam menulis bahasa pertanyaan (terutama Prometheus' PromQL), peraturan penggera, dan konfigurasi papan pemuka untuk alatan ini. Ia juga di mana AI berada pada tahap paling kukuh: meringkaskan sebahagian besar log dan metrik serta membenderakan anomali.
Mari kita jelaskan perbezaan antara pemantauan dan pemerhatian dalam satu ayat: pemantauan bertanya soalan yang anda sudah tahu (“Adakah CPU melepasi 90%?”); kebolehmerhatian ialah dapat bertanya soalan yang anda belum tahu ("mengapa kelambatan aneh ini hanya berlaku untuk pelanggan tertentu pada masa tertentu?"). Sistem moden sangat kompleks sehingga anda tidak dapat meramalkan semua mod kegagalan; Oleh itu, keupayaan untuk mengumpul metrik, log dan jejak yang kaya dan kemudian menanyakannya secara mendalam — iaitu, kebolehmerhatian — menjadi kritikal. Di sinilah AI berperanan apabila menjawab "soalan yang tidak diketahui sebelum ini": ia mengimbas data mentah yang anda miliki dengan cepat, mencadangkan corak dan anomali, dan anda mendapat punca dengan mengesahkan petunjuk ini.
Langkah demi langkah: apa dan bagaimana untuk memantau?
- Pilih metrik yang betul. Dalam industri, "empat isyarat emas" diambil sebagai asas: kependaman, trafik, ralat, ketepuan — seberapa penuh sumber itu. Ini meringkaskan kesihatan kebanyakan perkhidmatan.
- Kumpul metrik. Biarkan aplikasi membentangkan titik akhir yang boleh dibaca oleh Prometheus.
- Sediakan papan pemuka. Visualisasikan metrik ini dalam Grafana.
- Tulis peraturan penggera. Siapa yang akan diberi amaran apabila ambang melebihi dan bagaimana?
- Memusatkan log. Jadikan semua log perkhidmatan boleh dicari di satu tempat.
- Kurangkan bunyi bising. Terlalu banyak penggera mewujudkan "keletihan amaran"; Penggera penting hilang.
Petua: Penggera yang baik memenuhi dua perkara: ia boleh diambil tindakan dan mempunyai keperluan mendesak yang betul. Penggera yang membangunkan seseorang pada pukul 3 pagi mestilah sesuatu yang sebenarnya memerlukan campur tangan waktu malam. Jangan bangunkan sesiapa untuk sesuatu yang tidak memerlukan tindakan sendiri, seperti "CPU 70%"; memaparkannya di papan tulis.
Bagaimana untuk menulis peraturan penggera?
Makluman terdiri daripada tiga komponen: keadaan (metrik yang melebihi ambang mana dan berapa lama), tempoh ("selama 5 minit" untuk mengelak daripada mencetuskan turun naik seketika), dan kepentingan/tindakan (kepada siapa, melalui saluran mana). AI mahir menetapkan ketiga-tiga ini dengan konteks yang betul. Sebagai contoh, menterjemah peraturan seperti "penggera kritikal jika kadar ralat melebihi 5% selama 5 minit" ke dalam PromQL ialah tugas separa saat untuk AI — tetapi anda memutuskan sama ada ambang itu sesuai untuk sistem anda.
Awas: Ambang penggera yang dicadangkan oleh AI adalah andaian umum. Beban normal sistem anda, toleransi dan impak kerja adalah berbeza. Sebelum anda meletakkan ambang terus ke dalam prod, anda melihat data sejarah anda dan bertanya "berapa kali ambang ini telah dicetuskan pada masa lalu, berapa banyak daripada itu adalah masalah sebenar?" Jawab soalan.
Privasi log: amaran kritikal
Log adalah sumber kebocoran yang paling kerap diabaikan. Baris log mungkin mengandungi kata laluan, nombor kad kredit atau data peribadi secara tidak sengaja (di bawah KVKK/GDPR). Apabila menampal log masuk ke AI untuk analisis:
- Topeng kawasan sensitif. Gantikan nilai seperti token, kata laluan, e-mel, nombor ID dengan <REDACTED>.
- Berikan contoh, bukan semua. Daripada sejuta baris, beberapa ratus baris perwakilan selalunya cukup.
- Pilih kenderaan yang diluluskan oleh institusi. Terutama untuk log pengeluaran, gunakan alat yang datanya tidak pergi ke latihan.
Empat isyarat emas dan meja penggera
isyarat
diukur oleh
Contoh ambang penggera
segera
kependaman
masa tindak balas
p95 > 800 ms, 5 min
tinggi
lalu lintas
Permintaan/saat
Peningkatan/penurunan mendadak 300%.
sederhana
ralat
Kadar permintaan gagal
> 5%, 5 min
kritikal
Ketepuan
penghunian sumber
Cakera > 85%
tinggi
tiga kes mini
Kes 1 — 400 baris log diringkaskan dalam 30 saat. Satu perkhidmatan telah perlahan. Jurutera itu memberikan 400 baris log bertopeng kepada AI dan berkata, "ringkaskan corak ralat berulang dan keamatan masa." AI menunjukkan bahawa panggilan API luaran tertentu tamat setiap 30 saat. Punca punca ditemui dalam 30 saat; Mengimbas log secara manual akan mengambil masa setengah jam.
Kes 2 — keletihan penggera diselesaikan. Satu pasukan menerima 200 penggera sehari dan mengabaikan kesemuanya — sehingga penggera gangguan sebenar juga diabaikan. Berikan AI semua peraturan amaran dan tanya "yang mana tidak boleh diambil tindakan dan yang mana boleh digabungkan?" mereka bertanya. Bilangan penggera berkurangan kepada 12 setiap hari; Setiap penggera kini dipandang serius.
Kes 3 — ambang yang salah ditangkap lebih awal. YZ mencadangkan "Amaran apabila 95% penuh" untuk cakera. Jurutera melihat data sejarah: apabila cakera mencapai 95%, terdapat sedikit masa untuk campur tangan. Ia menurunkan ambang kepada 80% dan menambah penggera kedua berdasarkan "kadar pertumbuhan." Pengesahan menghalang gangguan tengah malam sebenar.
Empat templat yang boleh disalin
1) Ringkasan log (bertopeng):
Analisis contoh log di bawah (Saya menutup nilai sensitif dengan <DIREDACTED>). Beri saya: (1) corak ralat berulang, (2) penumpuan dari semasa ke semasa, (3) kemungkinan besar punca, dan (4) 3 metrik yang akan saya lihat untuk mengesahkan. Log: [LINES]
2) Penjanaan peraturan penggera:
Tulis peraturan penggera untuk Prometheus/Alertmanager: Jana penggera [SEVERITY] jika [THRESHOLD] melebihi [METRIC][DURATION]. Peraturan hendaklah berorientasikan tindakan dan termasuk medan anotasi dan pautan buku jalanan. Terangkan PromQL dan tulis mengapa ambang ini munasabah.
3) Menulis/mengisytiharkan pertanyaan PromQL:
Tulis pertanyaan PromQL yang mengukur: [EX. Peratusan kadar ralat 5xx dalam 5 minit terakhir]. Terangkan pertanyaan langkah demi langkah. Kemudian beritahu saya apakah julat sihat untuk nilai ini sepatutnya.
4) Reka bentuk papan pemuka:
Reka papan pemuka Grafana untuk [PERKHIDMATAN]: dengan panel manakah saya harus memaparkan empat isyarat keemasan (kependaman, trafik, ralat, ketepuan)? Cadangkan metrik, jenis visualisasi dan ambang yang munasabah untuk setiap panel. Tujuan: untuk melihat status kesihatan pengawal dalam 10 saat.
Gesaan lemah / Gesaan kuat
Lemah: "Apa yang ada dalam log itu?" (diikuti dengan 5000 baris log mentah, token di dalamnya)
Keputusan: anda membocorkan rahsia dan AI memberikan ringkasan dangkal yang tidak disasarkan.
Kuat: "Cari corak ralat berulang dan keamatan masa dalam contoh log bertopeng 300 baris di bawah; beritahu saya punca yang paling berkemungkinan dan metrik yang akan saya lihat untuk mengesahkan. Saya membuat token <DISEDURKAN>."
Perbezaan: gesaan kedua memberikan contoh bertopeng dan fokus, meminta output analisis yang jelas; Ia selamat dan berguna.
Kesilapan biasa
- Menampal log ke dalam AI tanpa menutupnya. Rahsia/kebocoran data peribadi yang paling biasa.
- Menetapkan penggera untuk segala-galanya. Keletihan penggera menguburkan penggera sebenar.
- Penggera tidak boleh bertindak. Ia adalah bunyi amaran yang tiada siapa boleh berbuat apa-apa.
- Menerima ambang AI tanpa persoalan. Ambang harus ditetapkan mengikut sejarah sistem anda.
- Hanya melihat metrik. Tanpa log dan jejak, punca utama tidak dapat ditemui pada kebanyakan masa.
- Tidak menetapkan masa penggera (untuk). Turun naik seketika menghasilkan penggera palsu.
Secara ringkasnya
Kebolehlihatan; Ia adalah keupayaan untuk memahami bahagian dalam sistem dari luar dengan metrik, log dan jejak. Empat isyarat emas (kependaman, lalu lintas, ralat, ketepuan) meringkaskan kesihatan kebanyakan perkhidmatan. AI sangat berkuasa dalam menulis pertanyaan PromQL, peraturan penggera dan papan pemuka, dan meringkaskan sebahagian besar log dan mencari anomali. Tetapi menjadi tanggungjawab anda untuk mengesahkan ambang penggera terhadap sejarah sistem anda sendiri, memastikan penggera berorientasikan tindakan dan jangan sekali-kali berkongsi log tanpa menutupnya.
Tugasan permohonan
Untuk perkhidmatan (atau perkhidmatan sampel): (1) Adakan peraturan penggera dijana untuk kadar ralat dengan templat "Penjanaan peraturan penggera" dan tetapkan ambang yang dicadangkan kepada "berapa kali ia dicetuskan pada masa lalu?" Uji dengan soalan; (2) menutup sampel log yang anda miliki dan pastikan ia dianalisis dengan templat "Ringkasan log"; (3) perhatikan metrik yang anda akan lihat untuk mengesahkan punca yang paling berkemungkinan.
senarai semak
- [ ] Saya memilih metrik untuk dijejak berdasarkan empat isyarat emas.
- [ ] Saya menutup semua log yang saya berikan kepada AI dari segi kawasan sensitif.
- [ ] Saya mengesahkan bahawa setiap penggera adalah berorientasikan tindakan dan keperluan mendesak yang betul.
- [ ] Saya menguji ambang penggera terhadap data sejarah sistem saya.
- [ ] Saya menapis turun naik serta-merta dengan menambah (tempoh) pada penggera.
- [ ] Saya menggunakan metrik + log + jejak bersama-sama untuk punca.