Size: a a a

Боль Тимлида

2021 September 01

СА

Сергей Аксёнов... in Боль Тимлида
Или так, но это громоздко, и можно что-то потерять, пока новый сервис в системе прописываешь.
источник

PD

Phil Delgyado in Боль Тимлида
Мне быстрее добавить слово в select )
источник

IA

Igor A in Боль Тимлида
кибана достаточно легко добавляет новые размерности
источник

ДН

Денис Никульников... in Боль Тимлида
автомитизация в помощь
источник

PD

Phil Delgyado in Боль Тимлида
Эти данные все равно должны быть в логах )
источник

СА

Сергей Аксёнов... in Боль Тимлида
Да, но для этого надо знать, что именно добавлять. И тут вот такая визуализация очень помогает.
источник

PD

Phil Delgyado in Боль Тимлида
Так там же автокомплит )
источник

PD

Phil Delgyado in Боль Тимлида
Зачем несколько таблиц? Это плохой кейс для CH.
источник

AK

Anton Kucherov in Боль Тимлида
Зачем вообще использовать логи как распределенный трейсинг когда для этого уже есть инструменты и стандарты? 🤔
источник

PD

Phil Delgyado in Боль Тимлида
Если логов много и нужно искать, то все равно надо новый индекс (автовычислимое поле) делать и это уже на уровне эластика...
источник

ДН

Денис Никульников... in Боль Тимлида
когда логов 300+гб в день то это не такая уж плохая идея)
источник

PD

Phil Delgyado in Боль Тимлида
Трейсинг рассчитан на статистику, а не на конкретный запрос.
источник

PD

Phil Delgyado in Боль Тимлида
Э, а чем это не плохая идея?
источник

c

critskiy in Боль Тимлида
wat
источник

СА

Сергей Аксёнов... in Боль Тимлида
Ну смотри: вот на скрине реальный запрос по ошибкам 5xx. Допустим я пришёл сюда потому, что их стало больше. Вот колонка response_status_code - и я сразу вижу, что 503-х ошибок больше обычного, значит вероятно проблема в api-gateway. В redash мне надо сначала сделать группировку, а тут все возможные группировки сделали за меня уже.
источник

PD

Phil Delgyado in Боль Тимлида
Т.е. тот же jaeger не съест 300+ GB логов в день на протяжении пары недель. А CH - вполне.
источник

AK

Anton Kucherov in Боль Тимлида
В смысле на статистику?🤨 На статистику достаточно метрик. Логи нужны исключительно в рамках одного сервиса. Чтобы понять как конкретный запрос шел через набор сервисов и где застрял, используют распределенный трейсинг.
источник

ДН

Денис Никульников... in Боль Тимлида
ну мы всегда при поиске задаем интервал дат (примерно), если в единой таблицы лежат логи всех сервисов, то (несмотря на всю крутость olap бд) запрос все равно идет медленнее, т.к. объем данных все равно велик.
источник

PD

Phil Delgyado in Боль Тимлида
Угу. Но еще лучше это смотреть графиком в графане. И правильнее смотреть там, а уже оттуда по клику открывать логи (в lighthouse или в чем-то еще)
источник

PD

Phil Delgyado in Боль Тимлида
Все трейсеры по умолчанию рассчитаны на "храним один трейс из 1000", а не "храним вообще все".
Проверить путь конкретного запроса вчерашнего дня - они не умеют (
источник