Часть 8. Наблюдаемость: system-таблицы, метрики и алерты
Какие системные таблицы читать при разборе инцидента, какие метрики отдавать в Prometheus и какой минимальный набор алертов реально предсказывает отказ, а не создаёт шум.
Все статьи с тегом "Observability"
Какие системные таблицы читать при разборе инцидента, какие метрики отдавать в Prometheus и какой минимальный набор алертов реально предсказывает отказ, а не создаёт шум.
Три итерации архитектуры приёма телеметрии в ClickHouse на 50 млн событий/с: почему падает связка agent→gateway, чем плох WAL на диске и как устроен перелив в S3 через failover-коннектор с отдельным catchup-коллектором.
Почему в ClickHouse отказались от OTel-конвейера ради прямого переноса данных между базами: 37 млн логов/с на 70 ядрах против 2 млн на 800. Разбираем идею широких событий и динамические схемы через Merge.
431 ПиБ и 1.59 квадриллиона строк на 33 геошардах в AWS, Azure и GCP. Разбираем геошардинг, async inserts с 24-кратным батчингом, суточные партиции и трёхуровневую иерархию Distributed-таблиц.
Перевод статьи Engin Diri (Pulumi): 20+ production-проверенных практик для Kubernetes — ресурсы, namespaces, RBAC, NetworkPolicy, GitOps, Gateway API, observability, FinOps и supply chain security.
Введите ключевые слова для поиска статей