Перейти к содержимому
IMOEX 2078.78 2.8%
·Технологии·22 июля 2026 г.

ИИ научился объяснять открытия, но не предсказывать их: тест CUSP выявил пределы научного прогнозирования моделей

ИИ научился объяснять открытия, но не предсказывать их: тест CUSP выявил пределы научного прогнозирования моделей

Проверка 6 передовых ИИ-систем на 4 760 научных событиях показала: модели хорошо распознают возможные механизмы будущих достижений, но почти не умеют оценивать сроки и вероятность реальных прорывов

Современные системы искусственного интеллекта хорошо справляются с объяснением уже известных научных идей, но пока не могут надёжно прогнозировать будущие открытия. Это показало исследование с использованием системы оценки CUSP (Cutoff-conditioned Unseen Scientific Progress), которая проверила способность ИИ предсказывать реальные научные события в 8 дисциплинах.

Авторы CUSP проанализировали 4 760 проверяемых научных событий, произошедших после даты, до которой были обучены модели. В тестировании участвовали 6 передовых ИИ-систем, включая GPT-5.4, Claude S4.5 и DeepSeek R1. Их оценивали по 4 направлениям: способность предсказать, произойдёт ли открытие к определённому сроку; выбор правильного механизма, который приведёт к результату; разработка стратегии решения научной задачи; прогнозирование даты появления достижения.

Главный результат исследования — разрыв между пониманием научных механизмов и реальным прогнозированием.

В задачах выбора механизма модели значительно превосходили случайный уровень: GPT-5.4 достиг точности 79,2%, Claude S4.5 — 69,9%. Однако при оценке того, воплотится ли конкретное достижение в реальности, результаты оказались близки к случайному угадыванию: GPT-5.4 показал 49,1%, Claude S4.5 — 52,6%. Модели могли описать правдоподобный путь к открытию, но часто не могли определить, какой путь действительно приведёт к результату.

ИИ также систематически ошибался с временными рамками. Модели чаще предсказывали появление научных достижений позже, чем они становились публично доступными. Ошибка прогнозирования дат составила от 4,9 месяцев у LLaMA 3.3 до 15,7 месяцев у DeepSeek R1, а у некоторых моделей предыдущего поколения превышала 2 года.

Дополнительные знания не решили проблему. Когда моделям предоставляли доступ к информации через ограниченный по времени веб-поиск, результаты улучшались, если причина ошибки заключалась в отсутствии данных. Однако даже при наличии всей доступной информации сохранялся разрыв между знанием фактов и способностью предсказывать. В сравнении с ИИ люди-эксперты показали более высокую точность: 73% против 52,5% у GPT-4o в оценке осуществимости научных событий.

Авторы отмечают, что современные ИИ-модели обладают значительной ретроспективной научной компетентностью — они способны анализировать существующие знания и формулировать научно правдоподобные идеи. Однако прогнозирование будущих открытий остаётся отдельной задачей, требующей самостоятельной оценки. Это важно учитывать при использовании ИИ для выбора направлений исследований, распределения финансирования и принятия научных решений.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Источник: iXBT