Во внутренних представлениях LLM есть устойчивая структура, функционально аналогичная боли

Трое исследователей направления, которое изучает внутренние представления моделей и философии сознания применительно к ИИ опубликовали работу, в которой извлекли из активаций языковых моделей линейное направление боли. Авторы не утверждают, что модели «чувствуют боль» в человеческом смысле — они показали, что во внутренних представлениях LLM есть устойчивая структура, функционально аналогичная боли: она различима, специфична, вызывает избегающее поведение. Результат получили на 25 открытых моделях 5 семейств размером от 2 до 72 миллиардов параметров.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.