Наблюдаемость начинается в IDE: как инструментировать код без телеметрического шума
Практический цикл OpenTelemetry: zero-code как каркас, ручная семантика важных операций, локальная проверка и безопасная помощь AI.
Как scheduler освобождает ресурсы для работающего Pod, почему PDB не даёт абсолютной защиты и что измерить перед включением экспериментального resize-preemption.
Раздел: SRE
24 публикации
Страница 3 из 4
Разделы архива
Практический цикл OpenTelemetry: zero-code как каркас, ручная семантика важных операций, локальная проверка и безопасная помощь AI.
Как строить проверяемые RCA-гипотезы по метрикам, логам и трассам: нормализовать аномалии, связывать их по времени и service topology, показывать evidence вместо магического score.
Как связать observability с диагностическими задачами, ввести telemetry budget и сокращать метрики, логи и трассы без потери видимости во время инцидента.
Как связать код, live state, телеметрию и operational knowledge для AI-SRE — и почему decision trace, policy boundary и postcondition важнее красивого ответа.
Как превратить переключение дата-центра в регулярную проверку disaster recovery: полный пользовательский путь, контролируемая деградация, soak-период и проверяемый runbook.
Как объединить исторические endpoint: инвентаризировать контракты, разделить rollout на фазы, проверить кэш и сохранить старые ссылки через простой redirect.