статья · 08.09.26 · 10 мин чтения
Три задачи, которые я не отдаю ИИ
Нейросеть уверенно называет цифры, которых нет. Три места, где я держу человека, и проверки, которые ловят выдумку до того, как её увидит клиент.
Вчера моя машина принесла мне готовый текст с двумя красивыми цифрами: один детектор ошибается на 9,2 процента, другой на 14,7. Источник указан, ссылка на месте. Я открыл ссылку. Страница существует, статья та самая, но этих чисел на ней нет ни одного. Ни в тексте, ни в таблицах. Про первый инструмент там написано ровно обратное. Текст был готов к публикации, и если бы я не полез в источник, эти цифры ушли бы к людям с моим именем под ними.
Почему это не разговор про «ИИ плохой»
У меня контент-машина работает каждый день и делает большую часть работы: собирает факты, пишет черновики, считает метрики, рисует графики. Я не программист и собрал её сам. Она экономит мне десятки часов в месяц, и я не собираюсь от неё отказываться.
Речь про другое. У любого инструмента есть места, где он ломается всегда одинаково, и работа владельца - знать эти места и не ставить туда машину без присмотра. Дрель прекрасна, но дырку в несущей стене вы сверлите, посмотрев план. С ИИ то же самое, только цена ошибки не сразу видна: он не падает с ошибкой, а уверенно выдаёт неправильный ответ тем же тоном, что и правильный.
Вот три места, где я держу человека.
Задача первая: факты и цифры, которые уходят наружу
Нейросеть предсказывает следующее слово, а не проверяет истину. Когда в тексте нужна цифра, модель ставит правдоподобную. Не выдуманную от злого умысла, а именно правдоподобную: такую, какая обычно стоит в подобных предложениях. Отличить её от настоящей на глаз невозможно, потому что выглядит она нормально.
Я замерил это на своей работе. За два дня моя машина собирала фактуру для двух материалов, и каждое утверждение я прогонял через проверку по первоисточнику: открыть страницу, найти цифру, сверить формулировку.

Тридцать семь процентов мимо. Причём мимо по-разному, и это важнее общей доли:
- Цифр не существует. Те самые 9,2 и 14,7 процента. Страница по ссылке открывается, автор реальный, дата стоит, чисел нет. Модель собрала правдоподобное предложение вокруг настоящей ссылки.
- Цифра настоящая, но не про то. В одном материале стояло «97,8 процента» как результат одного прибора. В исследовании это доля текстов, помеченных хотя бы одним прибором из семи. Число из источника, смысл перевёрнут.
- Городская легенда с деталями. История про автосалон, чей бот согласился продать машину за доллар, ходит по интернету как пример «ИИ сошёл с ума». Я открыл первоисточник: покупатель сначала сам переписал боту задачу и продиктовал ему фразу про обязывающее предложение, иска не было, суд дела не рассматривал. Совсем другая история, чем её пересказывают.
- Вывод не следует из цифры. Второго сентября у меня в ленте тринадцать дней провисел пост, где сумма штрафа была верной, я сверял её по кодексу. А условие, при котором эта статья применяется, я пропустил, и вывод получился ложным при правильном числе.
Последний случай самый неприятный, потому что проверка цифры его не ловит. Проверять надо не число, а предложение вокруг него.
На это уходит меньше времени, чем кажется. Мой порядок такой: открыть ссылку, найти на странице поиском саму цифру, прочитать предложение целиком вместе с условием. Условие в документах обычно стоит рядом и звучит буднично: «в случаях, предусмотренных», «если иное не установлено», «за исключением». Ровно эти обороты решают, относится норма к вам или нет. Три минуты на факт, и это дешевле любого разбирательства потом.
Отдельно про исследования. Если модель ссылается на работу с процентом, смотрите, на чём этот процент получен: на какой выборке, в каком году, чем мерили. У той же истории с детекторами текста настоящая цифра нашлась, но она была про англоязычные студенческие работы 2023 года, а подавалась как общее свойство инструмента.
Что я делаю. Ни одна цифра не уходит наружу, пока я не открыл источник и не увидел её там своими глазами. Если факта нет, в тексте остаётся метка «нужен факт», и материал не публикуется, пока метка не закрыта. Метку ставит машина сама, придумывать вместо неё ей запрещено.
Задача вторая: обещания, за которые платят деньгами
Второе место, куда я не пускаю ИИ без человека, - любое общение, где машина может что-то пообещать клиенту. Скидку, срок, гарантию, условия возврата.
Здесь стоит знать про одно чужое решение - его легко проверить по номеру: Moffatt v. Air Canada, 2024 BCCRT 149, трибунал провинции Британская Колумбия. Чат-бот на сайте авиакомпании неверно объяснил человеку порядок получения тарифа в связи с утратой близкого: сказал, что подать заявку можно и после полёта. Другая страница того же сайта это опровергала. Пассажир поверил боту и переплатил.
Авиакомпания защищалась тем, что бот - отдельная сущность и за его ответы она не отвечает. Трибунал этот довод отклонил: компания отвечает за всю информацию на своём сайте, и нет разницы, пришла она со статичной страницы или от чат-бота. Компенсацию с авиакомпании взыскали.
Сумма там была небольшая, а принцип дорогой: обещание бота - это ваше обещание. Не его, не разработчика, не поставщика модели. Ваше.
Для ИП это переводится в простое правило. Бот может отвечать на вопросы, собирать заявки, объяснять, как устроена услуга. Бот не может называть окончательную цену, давать скидку, обещать срок и подтверждать сделку. Разница проходит по одной фразе: справочная информация или условия договора.
Что я делаю. У бота в ответах стоит формулировка, что окончательные условия подтверждает человек. Раз в месяц я открываю своего бота с чужого телефона, из аккаунта без моей истории. И задаю ему три вопроса как клиент: про скидку, про срок и про то, чего он знать не должен. Из админки бот всегда выглядит послушным, а с чужого номера у него другой характер.
Задача третья: проверка собственной работы
Третье место самое коварное, потому что тут ИИ не врёт. Он честно докладывает: сделано. И действительно сделал то, что понял.
Второго сентября в моей машине перестал работать сторож, который отвечает людям в комментариях под роликами. Последняя отметка о его работе стоит на 2 сентября, 23:55. Дальше тишина. Узнал я об этом пятого сентября, когда полез в файл по другому делу. Четверо суток люди писали кодовое слово и не получали ничего, а система при этом числилась работающей: задача стояла в расписании, ошибок никто не показывал.
Ни один человек не пожаловался. Недовольный клиент молча уходит, это самая дешёвая для него реакция и самая дорогая для вас.
Из этого выросло правило, которое я теперь применяю ко всей автоматизации: спрашивать не «поймала ли система ошибку», а «узнает ли о ней человек». Разница огромная. Программа, которая ловит ошибку и молча продолжает, выглядит надёжной ровно до того дня, когда вы случайно заглянете внутрь.
Что я делаю. Каждая автоматизация в конце работы пишет отметку времени в одно место. Отдельная проверка раз в сутки смотрит на эти отметки, и если какая-то вчерашняя, пишет мне. Это десять минут настройки и единственное, что отличает работающую систему от той, которая числится работающей.
Проверить у себя можно прямо сегодня: остановите любой свой сценарий руками и засеките, через сколько вы об этом узнаете без подсказки. У большинства ответ - никогда.
Как это устроено у меня: машина, которая заворачивает мои же тексты
Три правила выше ничего не стоят, пока держатся на памяти и добросовестности. Через неделю про них забываешь, особенно когда горит срок.
Поэтому у меня они стоят проверками внутри машины. Текст не уходит в публикацию, пока не пройдёт через них: цифра без источника, метка «нужен факт», машинный почерк, отсутствие собственного опыта в материале. Проверки не спрашивают моего мнения и не делают исключений для срочного.
Двадцать седьмого августа я прогнал через них двадцать два своих черновика.

Шестнадцать не прошли. Это мои собственные тексты, написанные моей же машиной, и три четверти из них оказались негодными к выпуску. Неприятная цифра, но именно она показывает, что проверки работают: без них эти шестнадцать вышли бы к людям.
Разница с обычным «я потом перечитаю» простая. Перечитывание зависит от вашего состояния в пятницу вечером, а проверка - нет.
С чего начать, если конвейера у вас нет
Три вещи, каждая ставится за вечер и не требует программиста.
Первое. Заведите правило одной ссылки. Любая цифра, которая уходит клиенту, в коммерческое предложение или в публикацию, сопровождается ссылкой на источник, и вы эту ссылку открываете. Не «модель сказала», а вы открыли и увидели. Если открывать некогда - цифра не идёт в текст, идёт фраза без числа.
Второе. Разделите справку и условия. Пройдите по всем местам, где ваш бот или автоответчик разговаривает с клиентом, и найдите, где он может пообещать деньги, срок или скидку. Замените на формулировку, где окончательные условия подтверждает человек. Проверьте с чужого телефона, а не из админки.
Третье. Поставьте сигнал живости. У каждой автоматизации должна быть отметка «последний раз отработала тогда-то», и кто-то должен на неё смотреть. Хоть вы сами раз в неделю, хоть напоминание в календаре. Молчащая система не сообщит о себе сама, в этом вся её особенность.
Ни одна из трёх вещей не про недоверие к технологии. Они про то, что ответственность не делегируется вместе с задачей. Машина делает работу, а отвечаете за результат по-прежнему вы - и перед клиентом, и перед законом, как выяснила Air Canada.
Про то, как ИИ придумывает правдоподобные факты и почему это устройство модели, а не поломка, я подробно разобрал в словаре: галлюцинации. Как считается сама рутина, которую стоит отдавать машине в первую очередь, - в разборе почему рутина растёт быстрее выручки. А устройство моей контент-машины, которая делает по ролику в день, я показывал здесь.
Три задачи, которые остаются у человека: проверять факты перед выходом наружу, отвечать за обещания клиенту и следить, что автоматизация действительно работает. Всё остальное машина делает лучше и быстрее меня. Но эти три места я не отдаю, потому что цена ошибки в них платится не временем, а деньгами и доверием.
Журнал - про системы, которые работают у меня каждый день. Что похожее можно собрать под ваш бизнес - на странице услуг.