Ну и мне думается (ессно могу ошибаться, т.к. это просто предположение), что раз проблема в кривых данных, то лучше не автотесты, а какой-нибудь парсер этих данных сделать/валидацию контента при загрузке/импорте, чтобы подсветить ошибки, и специалистам, которые данные вводят/проверяют, было понятно, что происходит