чувствительность ассертов скорее должна регулироваться критичностью функциональности. не во всех случаях false positive полезен, как вашем примере с мед техникой. там другие требования к продукту.
но изначально я говорила о нестабильных ожиданиях - когда кнопочка по каким-то причинам не стала активной - такой нестабильный тест ведет к потере времени на то, чтобы каждый раз разобраться, в чем причина падения.
в целом, если есть время и ресурсы на то, чтобы разбираться в false positive после каждого запуска - это же отлично. иногда некоторые части быстрее прокликать руками, чем тратить машинное время и время автоматизатора на разбор причин.
И «зависит от того, какая функциональность проверяется» - ровно то, про что я говорил.
Я знаю ребят, которые просто ставили авто-ретрай на тест, если кнопочка почему-то не отрисовалась.
А через три месяца по чистой случайности узнавали, что кнопочка не отрисовывается, когда приходит битый конфиг А/Б теста, а происходит это в одном из N случаев.
И тесты не «флакали», они ловили реальную проблему.
Просто между «разобраться почему падает» и «сделать тесты стабильнее» - выбрали второе.
И я не говорю «а давайте тратить время автоматизатора в любой непонятной ситуации».
Любая трата времени должна иметь понятную цель и быть приоритезирована.
Просто надо понимать, что нестабильными тесты может делать как работа тестов, так и работа приложения.
И работа автоматизатора не в том, что бы сделать тесты стабильно зелёными.
А в том, что бы делать тесты показательными.