Зачем пихать в Jaeger все подряд, если можно пихать только необходимый минимум информации который позволит локализовать проблему, дальше пойти в логи и метрики конкретного сервиса и увидеть, что случилось?
На сколько я помню там сэмплинг идет на выборку. Но если указать конкретный проиндексированный request_id записанный как тег/аттрибут извлечется нужный Span (и все его родители/дети) без проблем. Т.е. пишутся все запросы.
По разному. Клиентских вроде не много, внутренних много. Железо GKE, поэтому хз. Там шарятся ресурсы, нет выделенной ноды под Jaeger. Позже отпишу если дадут данные и разрешат раскрыть. В одном сервисе точно знаю 1000 спанов в секунду в среднем генерится. Там можно указывать вообще разные стратегии сэмплинга достаточно гибко в том числе писать вообще все трейсы. sampler.type=const, sampler.param=1
Ну, меня как раз интересует железо, нужное хотя бы на 10K внутренних вызовов в секунду. Для траблшутинга все равно проще CH, но статистику может быть собирать удобнее будет.
Ну то есть на CH поверх логов мне трейсинг обойдется (на такой нагрузке) в худшем случае в пару ядер и 16GB оперативки (это если нужно будет очень часто снимать метрики для той же графаны), а скорее всего вообще даст несущественный прирост нагрузки. Но если весь трейсинг влезет в 1core+8GB, то можно уже подумать.