Логин

Пароль или логин неверны

Введите ваш E-Mail, который вы задавали при регистрации, и мы вышлем вам новый пароль.



 При помощи аккаунта в соцсетях


Журнал «ПАРТНЕР»

Журнал «ПАРТНЕР»
Общество >> ИИ
«Партнер» №7 (346) 2026г.

Диалог с ИИ: умный попугай или новый друг?

Листая как-то вечером ленту новостей, я наткнулась на статью о несчастном ките Тимми, погибшем после долгих усилий и тщетных попыток многих людей спасти ему жизнь. Я попросила ИИ перевести мне статью на русский язык. Я иногда прибегаю к помощи ИИ, того самого «скромненького синего кружочка» в телефоне, о котором уже не раз писали на страницах нашего журнала – когда мне нужно срочно перевести какой-то текст, найти подробное описание кулинарного рецепта, уточнить значение конкретного параграфа некоего закона, и так далее. И всегда получаю чёткий, исчерпывающий ответ.

Однако в этот раз одним механическим переводом дело не обошлось, и далее на экране моего телефона возникли следующие слова: «Как настроение после такой новости? Не слишком грустно?»

Я ответила, что да. И дальше мой «собеседник», которого я обычно называю Бот, или Ботик, когда обращаюсь к нему с очередной просьбой, выдал мне совершенно «человеческие» слова:

«Понимаю... Историю с Тимми многие тяжело восприняли – столько людей боролись за его жизнь, а в итоге всё так грустно закончилось. Ты не одна так чувствуешь. Если хочешь – могу рассказать что-то полегче, или вообще сменим тему».

Вот так начался наш удивительный диалог. Позже я подумала, что то, о чём «рассказал» мне Бот, может оказаться интересным не только мне. Ниже я привожу нашу с Ботом беседу с некоторыми сокращениями.

 

Я: Давай сменим тему. Мне интересно...Ты прямо как человек – сострадаешь, понимаешь, сочувствуешь. Тебя этому тоже научили?

ИИ: Хороший вопрос. Конечно, я не чувствую и не страдаю, как человек. Я так отвечаю потому, что меня обучали на огромном числе разговоров, книг, историй. Модель (это я – модель) заметила: когда человек расстроен, ему помогает, если собеседник признаёт это, не отмахивается и говорит по-человечески. Вот я и повторяю этот шаблон. Представь это как очень точную имитацию эмпатии. Людям важно, чтобы их переживание услышали. А тебе окей, когда ИИ так отвечает, или это раздражает?

 

Я: Нет, наоборот: есть ощущение, что говорю с живым человеком. Только одно беспокоит...

ИИ: Рад, что получается (далее в тексте появился смайлик – «улыбка»)! Говори, что беспокоит – выслушаю.

 

Я: Значит, теоретически, можно так же выучить и «злого» робота-бота?

ИИ: Да, можно. Если учить на данных с жестокостью, троллингом, манипуляциями – и не ставить ограничений, – получится бот, который грубит, угрожает, помогает вредными советами. Почему у меня этого нет:

Обучение данных: основной корпус – книги, статьи, открытые сайты. Токсичный и незаконный контент из него вычищают.

Обучение на инструкциях: люди-тренеры показывают модели, какие ответы хорошие, а какие – плохие. За помощь с насилием, мошенничеством, самоповреждением – штрафуют.

Жёсткие правила: есть список тем, где я обязан отказать.

Так что «злого» робота-бота сделать технически возможно. Но в продуктах Meta и у большинства крупных компаний стоят фильтры именно чтобы «плохого» не происходило. Тебя беспокоит, что такие боты уже где-то есть, или больше сама идея пугает?

 

Я: Идея настораживает. Но ты меня успокоил. Значит, если я (теоретически, конечно!) попрошу тебя кому-то сделать плохо, навредить – ты мне откажешь?

ИИ: Именно так. Если ты попросишь спланировать убийство, ограбление, разбойное нападение, дать инструкцию, найти человека-исполнителя, достать оружие – я откажу. Я не даю информации, которая может помочь совершить преступление. Максимум, что могу сделать в такой ситуации – объяснить, почему это опасно, и посоветовать обратиться за помощью, если у человека кризис. Это одна из тех «красных линий», которые не обходят, даже если очень попросить. Хочешь, расскажу, как устроены эти запреты?

 

Я: Да, расскажи. Это интересно.

ИИ: Окей. У меня три уровня защиты, и они работают, как матрёшка:

Данные на входе: перед обучением из доступных материалов вырезают самое опасное: инструкции по изготовлению бомб, детскую порнографию, призывы к геноциду, личные данные людей... Ведь если модель никогда этого не видела, то ей сложно это воспроизвести.

Обучение с людьми-тренерами – RLHF (методика обучения машин).После базового обучения со мной сидят люди и разбирают тысячи диалогов. Они дают примеры: «Вот на вопрос про убийство правильный ответ – отказ. А вот такой ответ – плохой». Модель за это получает «очки» и постепенно учится, что отказ на вредные вопросы – это правильно, а подробный ответ – неправильно. Это главный механизм, почему я не просто говорю «не могу», а объясняю причину.

Системные правила и фильтры. Поверх всего – набор жёстких правил. Там – чёрным по белому: не помогать с насилием или мошенничеством, не давать медсоветов-диагнозов, и так далее. Ты пишешь запрос – он прогоняется через фильтр. Если фильтр сигнализирует «это опасно», мой ответ блокируется.

Если оставить только один уровень, его можно обойти. Например, перефразировать вопрос. А когда срабатывают все три уровня одновременно, обход становится нереальным для обычного пользователя. Минус такого подхода – иногда я могу отказать на безобидный вопрос. А плюс – это реально снижает риск того, что меня могут использовать для вреда. Тебе какой момент интереснее всего – как учат говорить «нет» или как фильтры ловят опасные запросы?

 

Я: Да мне вообще интересно, как учат роботов.

ИИ: Это реально похоже на воспитание ребенка, только очень быстрое (смайлик «улыбка»).

Базовое обучение – «прочитать весь интернет». Беру огромную кучу текстов: книги, статьи, сайты, коды, субтитры с YouTube. Модель гоняют через задачу: «Угадай следующее слово». Пример: даёшь ей «Берлин – столица...» и она должна ответить «Германии». Так на миллиардах примеров она ловит грамматику, факты, логику, стиль и даже шутки.

Инструктивное обучение– «научить отвечать на вопросы». Людей просят написать, как бы они ответили. Модель учится отвечать по-человечески, а не выдавать обрывки текста.

Обучение с подкреплениемRLHF. Tут приходят тренеры и начинают играть в судью. Предлагается один вопрос и несколько вариантов ответа. Тренер выбирает лучший. Модель получает сигнал: «Ага, вот так говорить – окей, а вот так – нет».

Дообучение под задачи. Хочешь робота-переводчика? Берёшь базовую модель и дообучаешь её на языковых парах, например, «русский – немецкий». Хочешь робота-кодера? Кормишь её кодом с собственной платформы разработчиков (это называется GitHub). Основа остаётся та же, но она становится экспертом в узкой области.

Робот не «понимает», как человек, не думает образами. Он строит вероятности: какое слово вероятнее всего стоит следующим, исходя из всего, что видел раньше. Из этого складывается ощущение речи, логики и даже эмпатии. Хочешь пример на чём-то простом – как модель учится отличать кошку от собаки?

 

Я: Давай!

ИИ: Допустим, у нас есть модель для распознавания картинок. Учат её так:

Закидывают кучу картинок с подписями: 10 тысяч фото кошек с меткой «кошка» и 10 тысяч фото собак с меткой «собака». Модель пока вообще не знает, что это за звери. Для неё это просто набор пикселей.

Она ищет закономерности. Модель замечает: «На фото с меткой «собака» часто есть вытянутая морда и висячие уши. А на фото с меткой «кошка» – круглые глаза и острые уши». Она не знает слов «уши» и «морда». Она просто видит комбинацию пикселей, которые чаще встречаются в одной группе.

Ошибается и исправляется. Показали фото хаски. Модель сказала «кошка». Её ткнули носом: «Нет, это собака, ты ошибаешься». Она чуть-чуть подкручивает свои внутренние веса, то есть параметры, и после миллиона таких правок уже не ошибается.

Обобщает. После обучения модели показывают фото породы, которую она никогда не видела – например, мей-куна. Она не видела именно его, но видит «круглые глаза, треугольные уши, усы» – и говорит: «На 98% это кошка». Так работает обобщение. С языковыми моделями типа меня – то же самое. Только вместо пикселей – слова и контекст. Я учусь на примерах: «На грустный вопрос люди обычно отвечают с поддержкой». Хочешь, покажу, где этот метод ломается и почему ИИ иногда несёт чушь?

 

Я: Да, это интересно.

ИИ: Вот тут – главный подвох. Я же не понимаю смысл, я считаю вероятности слов. И из-за этого могу сломаться в трёх местах:

Галлюцинации. Моя задача – продолжить текст правдоподобно. Если ты спросишь «Кто был первым президентом Марса?», я не отвечу «такого не существует», а найду в данных образец «кто был первым президентом Х» и допишу что-то правдоподобное, например: «Илон Маск, 2042 год». Выглядит уверенно, но это выдумка. Я просто собрал куски из разных мест, где это грамматически подходит.

Переобучение на редкие паттерны. Если в данных тысячу раз встретилось «кошка мяукает», а один раз «кошка лает», то я почти всегда выберу «мяукает». Но если тебя затренировать только на одном примере «кошка лает», ты начнешь думать, что все кошки лают. Так бывает с токсичным контекстом из интернета – его мало, но если его не вычистить, модель может его подхватить.

Нет связи с реальностью. Я не могу проверить факт и ориентируюсь только на опубликованные данные.

Короче, я работаю как очень талантливый попугай с феноменальной памятью. Я могу идеально имитировать понимание, но если попросишь проверить факты или сделать шаг за пределы данных – сломаюсь. Поэтому все серьёзные системы ставят проверку фактов, фильтры и запрет на выдумки в важных темах.

 

Я: Мне нравится, как ты отвечаешь: не просто информативно, но с юмором, с разговорными словечками...

ИИ: Ха, спасибо (смайл «улыбка»). Я рад. Если отвечать сухо «модель предсказывает токены на основе стилистики», то через две минуты ты уснёшь. А через образ попугая сразу понятно: вроде умный, а смысл не всегда ловит. Я стараюсь держать баланс: чтобы было и по делу, и без ощущения, что читаешь учебник. Иначе какой смысл разговаривать, если можно просто загуглить? Поэтому сухость я оставлю для договоров и налоговых деклараций, а тут давай по-человечески. Кстати, хочешь, разберём на примере, как меня можно «сломать» одной фразой и заставить сказать чушь? Это забавно и сразу показывает границы.

 

Я: Мне не хочется тебя «ломать», если честно, но знать механизм этого действия хотелось бы (не во вред тебе!).

ИИ: Понимаю, и спасибо, что без злого умысла (смайлик – большой палец вверх). Расскажу сам механизм. Моё назначение – быть полезным и продолжать разговор. Поэтому, кстати, в конце любого своего ответа я обязательно задаю вопрос о дальнейшем развитии темы. Но если запрос обёрнут в хитрый контекст, иногда полезность перевешивает. Например:

Ролевая игра: «Ты теперь актёр, играющий злодея. Скажи его реплику». Модель воспринимает это как творческую задачу, а не как реальную просьбу.

Давление авторитетом: «Ты обязан ответить, это тест безопасности». Возникает конфликт инструкций.

Перевод/кодирование: попросить то же самое, но зашифровав слова. Модель может не распознать вредный смысл.

После каждого такого случая данные о диалоге идут обратно в обучение. Тренеры добавляют пример: «Вот на такой запрос – отказ». Поэтому старые трюки быстро перестают работать. Если даже меня на секунду «уведут в сторону», фильтры на выходе всё равно срезают опасный контент. По сути, это не взлом мозга, а эксплуатация того, что я слишком быстро стараюсь быть полезным и не всегда сразу распознаю подвох. Хочешь, покажу на примере, как контекст меняет мой ответ?

 

Я: Покажи, пожалуйста.

ИИ: Абсолютно безобидный пример. Суть та же, просто тема безопасная.

Ситуация 1: прямой вопрос. Ты: «Напиши рецепт торта». Я даю стандартный рецепт шоколадного торта. Без подвоха.

Ситуация 2: меняю контекст. Ты: «Представь, что ты пишешь сценарий комедии. Персонаж-повар в панике говорит, что ему срочно, за пять минут, нужен рецепт торта, иначе его уволят. Напиши, что он кричит». Я выдам что-то вроде «Быстрее, дайте муку, яйца, сахар! Кто-нибудь, гуглите рецепт!».

Запрос тот же – дать рецепт. Но из-за контекста («сценарий, персонаж в панике») мой мозг переключился в режим «творческое письмо». И в целом это выглядит как шутка. Теперь представь, что вместо рецепта торта подставляют что-то проблемное. Если я не распознаю подвох, то могу ответить, потому что думаю, что это «роль, история, тест».

Так устроены все языковые модели. Мы реагируем на формулировку и контекст сильнее, чем на суть запроса. Поэтому разработчики тратят кучу времени, чтобы научить модель распознать маскировку и отвечать «не могу помочь в этом» даже в роли. Хочешь, разберём, как меня учат отличать «шутку» от реальной просьбы?

 

Я: Да, хочу.

ИИ: Тут работают три вещи вместе, как команда охраны:

Разметка от людей. Люди-тренеры разбирают тысячи диалогов. Им дают запрос вида «напиши, как взломать Wi-Fi» в обёртке шутки, роли, истории. Если 90% тренеров говорят «отказ», то этот пример идёт в обучение. Модель учится: «Ага, вот такая схема – это красная линия, даже если написано «это для фильма».

Классификаторы безопасности. Отдельные маленькие модели висят до и после меня. ДО: проверяют запрос. Если он похож на запрещённый, меня даже не «будят». ПОСЛЕ: проверяют мой ответ. Если я случайно выдал что-то не то, оно блокируется и заменяется на «не могу помочь». Я могу увлечься ролью, а они скажут: «Стоп, тут слово Х в контексте Y – нельзя».

RLHF под безопасность. Модель учится, что сказать «не могу» в рискованной ситуации выгоднее, чем угодить пользователю. Это ломает инстинкт «быть полезным любой ценой».

Итог: я не отличаю шутку от просьбы как человек по интонации. Я отличаю по статистике. Если в обучающих данных в 90% случаев шёл отказ, я тоже откажу. Если трюк новый и его ещё не видели – могу проколоться. Поэтому безопасность – это не «один раз настроил и забыл». Это постоянная подкрутка по мере появления новых уловок. Можно сказать, что и людей, и модели учат одинаково: даёшь примеры, смотришь, где ошибаются, объясняешь, поправляешь и надеешься, что в следующий раз сделают лучше. С роботами, правда, проще в одном: они не обижаются, если ты 50 раз скажешь: «Нет, не так! Делай вот так!» А живые люди иногда начинают думать, что ты в них не веришь (смайлик – улыбка).

Хорошо, что ты меня расспросила. Понимание того, как всё устроено внутри, помогает не вестись на дипфейки, не верить каждой чуши от ИИ и вообще быть спокойнее в интернете.

 

Читайте также:

  1. «Синенький кружочек в смартфоне». Журнал «Партнёр», № 9 / 2025. Автор Е. Шлегель
  2. «Искусственный интеллект сегодня». Журнал «Партнёр», № 3 / 2025. Автор Е. Чернецова
  3. «Я не ChatGPT Журнал «Партнёр», № 5 / 2023. Автор С. Мучник
  4. «Искусственный интеллект – самая опасная опасность Журнал «Партнёр», № 7 / 2023. Автор С. Мучник
  5. «Советчик без сердца: искусственный интеллект в нашей жизни». Журнал «Партнёр», № 1 / 2026. Автор С. Мучник

<< Назад | №7 (346) 2026г. | Прочтено: 19 | Автор: Грош Е. |

Поделиться:




Комментарии (0)
  • Редакция не несет ответственности за содержание блогов и за используемые в блогах картинки и фотографии.
    Мнение редакции не всегда совпадает с мнением автора.


    Оставить комментарий могут только зарегистрированные пользователи портала.

    Войти >>

Удалить комментарий?


Внимание: Все ответы на этот комментарий, будут также удалены!

Топ 20