LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты
Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки? Внутри статьи: Архитектурный паттерн сдерживания: почему у классической нормализации должно быть право вето. CI-инварианты: как ловить галлюцинации моделей с помощью враждебных фикстур в grounded-judge-gate. Разбор факапов: три реальных бага проектирования, которые едва не увели систему в ложноположительное пике.
