LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты

Как перестать доверять LLM-судье на слово и построить безопасную двухконтурную систему оценки?
Внутри статьи:
Архитектурный паттерн сдерживания: почему у классической нормализации должно быть право вето.
CI-инварианты: как ловить галлюцинации моделей с помощью враждебных фикстур в grounded-judge-gate.
Разбор факапов: три реальных бага проектирования, которые едва не увели систему в ложноположительное пике.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.
Источник: Habr