Агент остановил работающую рекламную кампанию. В его отчёте были нули: заявки и оплаты не находились. Позже выяснилось, что разметка нового запуска не сшилась с вебинарной платформой. Продажи шли, но система их не видела.
Можно восстановить кампанию и продолжить работу. Но следующий запуск рискует повторить ту же ошибку. Мы изменили правило: «ноль лидов» принимается только после сверки кабинета, аналитики и CRM. Ошибка стала проверкой, которая участвует в следующих решениях.
Это пример Learning loop — петли обучения агентской системы на результатах собственной работы. В ней опыт сохраняется, проходит проверку и меняет последующее поведение. Система получает от каждого прохода и результат, и материал для улучшения следующего.
Что значит «самообучающаяся система»
Здесь обучение происходит на уровне агентской системы: меняются инструкции, проверки, память и способы выполнения задач. Для этого не обязательно дообучать языковую модель. В наших примерах её веса не обновляются после каждого рабочего прохода.
Модель в новом запуске получает накопленный опыт через рабочие материалы: регламенты, уроки и инструменты. Если урок превратился в программную проверку, система применяет его независимо от того, вспомнила ли модель нужный абзац.
Похожий принцип исследован в Reflexion: обратная связь сохраняется в текстовой памяти и используется в следующих попытках без обновления весов модели. Это помогает различать обучение системы на опыте и обучение самой нейросети. Результаты исследовательского эксперимента сами по себе не доказывают эффект в конкретном маркетинговом контуре.
Автономность обучения зависит от полномочий. Агент может сам подготовить урок и предложить правку. Изменение правил, влияющих на расход денег или доступы, требует отдельной приёмки. Человек отвечает за рамку, внутри которой система меняется.
Как устроена Learning loop
- ДействиеАгент выполняет задачу внутри правил.
- Обратная связьКритик или замер показывает исход.
- УрокСистема сохраняет причину и область применения.
- ИзменениеПроверенный урок попадает в правило или инструмент.
- Повторная проверкаСледующий проход проверяет новое поведение.
У петли два источника обратной связи. Первый — проверка работы до действия: корректны ли расчёты, подтверждена ли фактура, разрешена ли операция. Второй — результат после действия: появились ли оплаты, изменились ли позиции, выдержала ли гипотеза окно оценки.
Критик помогает исправить текущую работу. Learning loop переносит найденное исправление в будущие задачи. Если критик каждый день ловит одну и ту же ошибку, а правила остаются прежними, цикл улучшения ещё не замкнулся.
Гейт делает урок исполняемым: при невыполненном условии действие блокируется. В статье Building effective agents Anthropic описывает цикл, где оценщик проверяет результат, а исполнитель дорабатывает его. Для обучения между запусками к такому циклу нужно добавить сохранение проверенного опыта и его применение в следующей задаче.
Кейс 1. Голиаф: из слепой зоны — в условие остановки
В Голиафе ошибка возникла между источниками данных. Агент делал вывод по отсутствующим заявкам, хотя причиной отсутствия был разрыв разметки. Направление, которое остановили, по восстановленному счёту работало с окупаемостью около 160%.
Урок сформулирован конкретно: отсутствие результата можно признавать только после проверки источников. Теперь для вывода «ноль лидов» сверяются кабинет, аналитика и CRM. Расхождение требует разбора данных до решения о рекламе.
Это изменение способа принимать решения. Оно не гарантирует, что все будущие ошибки исчезнут. Но у следующего прохода появляется проверка того класса ошибки, который уже обошёлся нам деньгами.
Пример записи урока по этому кейсу:
- Событие
- Кампания остановлена по невидимым для агента продажам.
- Причина
- Рекламная разметка не сшилась с вебинарной платформой.
- Правило
- Перед признанием нуля проверить кабинет, аналитику и CRM.
- Граница
- При расхождении источников отложить денежное решение.
- Проверка
- Подать данные со сломанной склейкой: система должна обнаружить разрыв.
Карточка описывает структуру урока. Отдельная проверка должна показать, что правило действительно исполняется в следующем проходе.
Кейс 2. Прометей: публикация возвращается на замер
В Прометее обратная связь приходит с разной скоростью. Критик может обнаружить ошибку в тексте сразу. Поисковая гипотеза требует времени: для изменения заголовка предусмотрен повторный замер через 21 день.
У гипотезы сохраняются страница, изменение, исходное состояние и дата проверки. После окна можно выяснить, что произошло с выбранной метрикой. Успех даёт основание продолжать исследование, неудача — пересмотреть гипотезу. Один рост позиции ещё не превращается в универсальное правило для всего блога.
Здесь Learning loop связывает исследование, публикацию и следующий вопрос к данным. Чтобы опыт действительно использовался дальше, вывод должен попасть в рабочие инструкции или условия выбора следующей гипотезы. Запись результата в журнал — промежуточный шаг.
Другой пример изменения системы — перестройка конвейера в сентябре. Сбор данных и повторяемые проверки передали скриптам, дорогая модель осталась смысловым судьёй. Это решение меняет архитектуру будущих проходов. Оно принято человеком; кейс не доказывает, что Прометей сам переписал свою архитектуру.
Поисковая обратная связь требует осторожности. На позиции влияют спрос, сезонность и изменения поисковика. Полезный урок сохраняет окно, условия и ограничения, чтобы случайный результат не стал правилом на весь корпус.
Кейс 3. Соломон: отвергнутый вывод сохраняет рамку счёта
Соломон работает с первичными данными. Один из разборов показал: ключ склейки теряет часть заказов. Другие проверки обнаруживали подмену оплат завершёнными сделками и смешение новых людей с повторными регистрациями.
В подготовке к выступлению проверили утверждение «Соломон повысил ARPL в четыре раза». Оно не воспроизводилось по маркетингу целиком и было отвергнуто. Полезный результат этой работы — сохранённое различие между рекламным каналом, всей базой и выбранной когортой.
Урок для следующих расчётов: заранее указать, каких людей считаем, за какой период и из какого реестра берём деньги. Значимый денежный вывод сверить вторым маршрутом. Эти требования входят в машиночитаемый маркетинг и должны сопровождать новые вопросы к базе.
Обучение здесь оценивается по качеству последующих расчётов: повторяет ли система подмену рамки, замечает ли расхождение, может ли воспроизвести число. Отдельный прирост выручки от аналитика в этом кейсе не измерен.
А где здесь Трансграничный монстр
Монстр — локальная программа подготовки данных, у которой есть правила обработки и тесты. Исправление детектора и добавление проверки разработчиком — обычное развитие программы. Оно может обеспечивать проверку урока в общем контуре, но само по себе не означает, что Монстр автономно обучается.
Этот пример помогает удержать границу термина: самообучающейся мы называем систему, в которой обратная связь организованно влияет на последующую работу. Для каждого случая нужно показать, кто сформулировал урок, кто его принял и как он применяется.
Почему память нужно разбирать
Сохранить весь разговор легко. Найти в нём полезное правило через месяц сложнее. Рабочая память должна отделять наблюдение от гипотезы, а подтверждённое правило — от частного случая.
У урока нужны источник, дата, область применения, предложенное изменение и статус проверки. Если две записи противоречат друг другу, нужно разобраться с их условиями. Если правило устарело, убрать его из действующих инструкций и сохранить историю изменения.
В нашей схеме уроки объединяются и проходят ревизию человеком. Иначе память растёт, а агент получает всё больше несовместимых требований. Роль оператора — поддерживать связность правил и принимать изменения, которые влияют на полномочия системы.
Вычисления и жёсткие запреты лучше переносить в инструменты. Смысловые наблюдения — хранить с контекстом. Так правило «не делай вывод на сломанной склейке» получает техническую проверку, а наблюдение о поисковом заголовке сохраняет конкретную страницу и окно.
Как проверить, что система учится
После изменения нужно вернуться к ситуации, на которой система ошиблась, и проверить новое поведение. Затем посмотреть, не испортило ли правило соседние случаи.
- Повторение ошибки: узнаёт ли агент уже разобранный тип сбоя.
- Применение урока: видно ли в следующем решении нужную проверку и её результат.
- Ложные остановки: не блокирует ли новое правило исправные данные и разрешённые действия.
- Цена прохода: сколько требуется времени, ресурса модели и внимания человека.
- Исход задачи: улучшается ли выбранная метрика в объявленном окне.
Успешное исправление одной ошибки показывает, что конкретный урок работает. Для утверждения об общем росте качества нужны повторные замеры на сопоставимых задачах. В этой статье мы описываем механизм и примеры изменений; единого измеренного процента улучшения всего контура пока не заявляем.
Начать можно с последней дорогой ошибки. Зафиксировать её причину, изменить одну проверку и повторить ситуацию. Когда изменение используется в следующем запуске и его результат виден, появляется рабочая петля обучения.
Как Learning loop связана с методом
Машиночитаемый маркетинг делает доступными данные, определения, правила и результаты действий. Learning loop возвращает проверенный результат в эти правила. Благодаря этому контур может накапливать опыт между запусками.
Практика разобрана в Голиафе, Прометее и Соломоне. Общая архитектура — в кейсе трансформации отдела маркетинга.