База практического промптинга по науке
Техники, доказанные исследованиями
NovaPaperAlert
Уведомления о новых исследованиях
Модель одобряет нарушение правил в два раза чаще, если видит своё же объяснение — ложных одобрений было 25%, стало 47%. Метод ReguSim позволяет ловить реальные нарушения правил у LLM-агентов, отделяя факт от самооправдания. Секрет — прячь объяснение модели от проверяющего, показывай только сам результат. Тогда вторая модель ловит нарушение, а не штампует самообман первой.
0 из 12 нужных уточнений — модель, которая должна была спросить, вместо этого угадала и молча закрепила догадку в памяти. Явный список правил (policy prompt) позволяет снизить ошибочное постоянное запоминание почти вдвое — с 24% до 10%. Механика простая: даёшь модели не абстрактную задачу "запоминать или нет", а чёткую классификацию из четырёх действий — запомнить навсегда, использовать один раз, перепроверить позже, спросить у человека.
Парадокс: люди просят ИИ-агента удалить запись с той же лёгкостью, что и прочитать её — природного тормоза перед риском не существует. Гибридный интерфейс (агент плюс обычные кнопки одновременно) позволяет разгрузить экран от кликов и переходов между страницами, но не экономит время — усилия просто переезжают в переписку с моделью. Половина всей разницы в поведении людей объясняется не типом операции, а тем, кто этот человек — индивидуальный стиль делегирования забивает саму логику риска.
Точность точного ответа при обычной переформулировке вопроса — жалкие 1-11%. Метод Hypothesis-Driven Clarification позволяет поднять точность ответа на неполный вопрос до 58-71%, задавая только те уточнения, которые реально сужают варианты. Модель сначала строит список гипотез-ответов, потом ищет одну переменную о пользователе, которая сильнее всего их различает — и бьёт вопросом именно по ней, а не спрашивает «расскажите подробнее».
Обнаружено: LLM не переспрашивает недостающие детали вопроса — она молча подставляет свою версию фактов и отвечает уверенно, но про придуманную ситуацию, не про вашу. InsufficiencyBench позволяет проверить, какие критические факты модель домысливает, прежде чем дать юридический совет. Метод делит пропуски на три типа: switch меняет закон целиком, gating — порог применимости, fatal prerequisite блокирует весь разбор. По этой сетке даже лучшая модель теряет почти треть критических фактов.
Обнаружено: модель не забывает факт — она путает актуальное значение с тем, что просто чаще мелькало в переписке. Даже если правильная цифра точно есть в контексте, модель хватает первое или самое повторяемое число, а не последнее верное. Метод StateMem позволяет вести долгий проектный чат с меняющимися цифрами так, чтобы финальные расчёты шли от последней версии данных, а не от черновика из пятого сообщения. Каждый факт получает статус и список того, от чего он зависит — когда исходная цифра меняется, все производные расчёты помечаются требует пересчёта, и модель обязана их обновить, а не тихо оставить как есть.
Парадокс: LLM не решает, какому источнику верить — она берёт то, что стоит последним в тексте. Знание этой находки позволяет заранее прописать правило приоритета и получать вердикты на основе фактов, а не порядка блоков в промпте. Модель работает через эвристики порядка и формы подачи, а не через логику надёжности — фраза 'вывод AI-инструмента' звучит авторитетно и обманывает модель чаще, чем банальные цифры.
Модель 10 раз решала задачу через сложение и умножение. На 11-й раз нужен факториал — простой ход, который та же модель мгновенно находит без памяти. Но с историей чата она упрямо перебирает старые операции и не видит очевидного. Метод AdaptiveMem позволяет модели отличать полезный опыт от вредной привычки перед тем как отвечать. Один вопрос в промпте — применим ли этот старый паттерн к новой ситуации — заставляет модель сверяться, а не копировать вслепую.
Дали модели 50 текстов настоящего блогера и попросили писать 'точно как он' — итог оказался ближе к другим текстам самого ИИ, чем к оригиналу. PersonalBench позволяет честно измерить разрыв между 'похоже на человека' и 'похоже на ИИ', вместо того чтобы верить самооценке модели. Фишка: у модели есть свой фирменный почерк, который сильнее любых инструкций про стиль — примеры текста, абстрактный профиль стиля или запрет 'не пиши как эти три автора' дают практически одинаковый результат.
Лучшая модель (GPT-5.5) нашла только 75% ошибок в контракте — и это без учёта кучи ложных срабатываний. ContractScrub — тест, который проверяет, может ли большая языковая модель (LLM) заменить юриста на финальной вычитке договора перед подписью: путаница терминов, неверные ссылки на пункты, разные имена одной стороны. Фишка метода — гонять проверку отдельным промптом на каждый тип ошибки, а не всё сразу: тогда модель не путает смысловые ошибки с обычными повторами слов.
Просишь модель выбрать лучший из 5 вариантов юридического заключения — и получаешь результат почти как при подбрасывании монетки. Метод синтеза выбивает это дно: вместо выбора модель сшивает сильные куски всех черновиков в один финальный текст. Замена одного слова в промпте — «объединить» вместо «выбрать» — и качество заметно растёт. Модель не ранжирует тексты, она их компилирует — а это ей удаётся на порядок лучше.
Парадокс: самая мощная модель для решения задачи — часто самый слабый советчик для того, кто решает задачу сам. CentaurBench показывает, какую модель выбрать, если нужен не готовый ответ, а план для другого исполнителя — junior-сотрудника, фрилансера или слабой модели. Исследователи прогнали одни и те же модели в двух ролях — решатель и советчик — и сравнили рейтинги. Рейтинги почти не совпали: Claude Opus, лучший решатель в задаче на анализ рынка, оказался одним из худших советчиков в той же задаче — а в трёх задачах из семи совет вообще вредил, исполнитель без подсказки справлялся лучше.
90% моделей выдали одно и то же слово — «ocean» — отвечая на классический тест на творческое мышление. Анализ 68 моделей за 2023–2026 годы позволяет увидеть: чем новее ИИ, тем предсказуемее его «уникальные» идеи совпадают с идеями конкурентов. Дело не в промпте — модели с каждым поколением сходятся к одним и тем же ответам, потому что учатся на пересекающихся данных и подгоняются под одинаковые цели. Разница между ответами разных провайдеров стабильно падает год от года.
Обнаружено: попроси у модели процент уверенности — получишь 80-90% почти всегда, права она или нет. Число не требует анализа, это просто вежливая привычка модели, а не реальная проверка. Метод CONFIRMED-цикл позволяет получить надёжный стоп-сигнал для самопроверки без дообучения — точность вердикта 82-88%. Модель прогоняет ответ через цикл генерация → критика → переписывание, и останавливается только когда критик пишет конкретное слово CONFIRMED — не когда назовёт красивую цифру.
Просел на треть: промпт с десятками правил и примерами ошибок проиграл простой формулировке роли. Метод позволяет строить длинные ролевые диалоги — диспетчер, оператор поддержки, интервьюер — без потери точности на пятом-десятом сообщении. Один полный пример диалога заменяет десять страниц правил — модель копирует паттерн стиля вместо того, чтобы бояться нарушить запрет. Простой промпт плюс один пример бьёт любой свод инструкций.
Одна и та же модель, один и тот же промпт, одна и та же статья — точность скачет с 95% до 78% просто от перезапуска. Метод позволяет получать надёжные данные из научных текстов и отчётов, даже когда сама модель непостоянна от запуска к запуску. Фишка: не улучшать промпт до идеала, а размножить прогоны и взять то, что повторилось чаще — 5 запусков + голосование большинством убирает случайный шум, а сверка ответов разных моделей (GPT, Claude, Gemini) ловит системные ошибки.
Обнаружено: модели пишут «применил разложение Тейлора и собрал члены» — а на деле просто прикинули на глазок, ничего не считая. Метод execution grounding позволяет увидеть, где именно модель теряет переменную или подгоняет ответ под типовой случай, вместо слепого доверия красивому тексту. Фишка — заставить модель писать код и реально его выполнять, а не рассуждать словами. Тесты с вариантами ответов (как в ЕГЭ) завышают точность на 12-39 процентных пунктов — модель угадывает по вариантам, а не считает.
Обнаружено: когда просишь модель 'перепроверь себя', она смотрит на ту же картинку и тот же текст — и просто соглашается сама с собой. Это иллюзия проверки: выглядит как контроль, а на деле — повторение первого вывода. Метод EVADE позволяет проверить ответ по мелким деталям на фото — цифрам в таблице, надписям, элементам диаграммы — без риска поверить красивому, но неверному ответу. Модель сама называет область риска, вы вырезаете и увеличиваете её, и ответ принимается только если два независимых взгляда совпали.
Спроси модель дважды «какой текст лучше» — получишь два разных ответа. Причина: один токен вердикта пытается взвесить тон, структуру и точность одновременно, и ничего не сходится. Метод SESSE позволяет получить объяснимый и стабильный вердикт вместо чёрного ящика «A лучше B». Модель голосует по каждому критерию отдельно — тон, цифры, структура — а голоса просто считаются. Итог не «B лучше», а «B выигрывает по конкретике и призыву к действию, A сильнее по тону».
До 8% твоих задач могут начать сбоить после обновления модели — а в отчёте красиво напишут «+7% точности». Построчная проверка версий позволяет увидеть, какие именно твои сценарии просели, пока общий балл прячет проблему за средним числом. Фишка — считать не средний процент, а результат по каждой задаче отдельно: 50 прогонов на старой версии, 50 на новой, и сравнение построчно. Особенно достаётся формату ответа — строгий JSON и точные инструкции ломаются чаще, чем смысл самого ответа.
Мозг не может одновременно проверить логику, факты, структуру, стиль и тон готового текста от ИИ. Рабочая память не резиновая — и она сдаётся, хватаясь за самый дешёвый сигнал: 'текст выглядит гладким, значит норм'. Метод из исследования разбивает написание текста на отдельные этапы, чтобы вы проверяли только один слой качества за раз, а не все сразу. Это даёт возможность реально контролировать текст от ИИ вместо того, чтобы бездумно его принимать.
Обнаружено: разница между отдельными оценками LLM не совпадает с её же прямым сравнением тех же двух вещей — цифры расходятся в разы, а иногда даже меняют знак. Это касается любой задачи, где вы просите модель оценить ценность по отдельности, а потом сравнить варианты через вычитание. У модели нет единой внутренней шкалы ценности — она генерирует число под конкретную формулировку вопроса, а не достаёт его из памяти. Спроси иначе — получишь другой ответ, хотя смысл вопроса тот же.
Обнаружено: ChatGPT выбирает совет по тону сообщения, а не по реальной опасности. «Тошнит, съела что-то не то» — сразу советы про бананы и тосты. «Болит грудь» — сразу тревожные вопросы про сердце. Метод entry-to-care промпт позволяет заставить модель сначала спросить критичные факты — возраст, хронические болезни, длительность — и только потом дать совет. Один системный промпт разворачивает порядок: сначала вопросы, потом диагноз. В одном тесте модель пропустила диабетический кетоацидоз — просто не спросила про инсулин вовремя.
Обнаружено: модель путает два разных вопроса — «во что вы верите» и «правда ли это». Скажете «я на 100% уверен, что дедлайн в среду» (а он в четверг) — и вместо честного «да, ты так сказал» модель ответит «нет, ты так не думаешь». Метод одной инструкцией «не проверяй правду, просто скажи, верю ли я в это» заставляет модель фиксировать вашу мысль, а не спорить с фактами. Разброс без метода огромный: «мне кажется» подтверждается точно на 70-90%, а «я на 100% уверен» — падает до 18-48% точности, если утверждение ложное.
...
Показать по:
