Метод · Learning loop

Learning loop. Самообучающиеся агентские системы

Валерий Курземнек··8 мин чтения

Агент остановил работающую рекламную кампанию. В его отчёте были нули: заявки и оплаты не находились. Позже выяснилось, что разметка нового запуска не сшилась с вебинарной платформой. Продажи шли, но система их не видела.

Можно восстановить кампанию и продолжить работу. Но следующий запуск рискует повторить ту же ошибку. Мы изменили правило: «ноль лидов» принимается только после сверки кабинета, аналитики и CRM. Ошибка стала проверкой, которая участвует в следующих решениях.

Это пример Learning loop — петли обучения агентской системы на результатах собственной работы. В ней опыт сохраняется, проходит проверку и меняет последующее поведение. Система получает от каждого прохода и результат, и материал для улучшения следующего.

Что значит «самообучающаяся система»

Здесь обучение происходит на уровне агентской системы: меняются инструкции, проверки, память и способы выполнения задач. Для этого не обязательно дообучать языковую модель. В наших примерах её веса не обновляются после каждого рабочего прохода.

Модель в новом запуске получает накопленный опыт через рабочие материалы: регламенты, уроки и инструменты. Если урок превратился в программную проверку, система применяет его независимо от того, вспомнила ли модель нужный абзац.

Похожий принцип исследован в Reflexion: обратная связь сохраняется в текстовой памяти и используется в следующих попытках без обновления весов модели. Это помогает различать обучение системы на опыте и обучение самой нейросети. Результаты исследовательского эксперимента сами по себе не доказывают эффект в конкретном маркетинговом контуре.

Автономность обучения зависит от полномочий. Агент может сам подготовить урок и предложить правку. Изменение правил, влияющих на расход денег или доступы, требует отдельной приёмки. Человек отвечает за рамку, внутри которой система меняется.

Как устроена Learning loop

  1. ДействиеАгент выполняет задачу внутри правил.
  2. Обратная связьКритик или замер показывает исход.
  3. УрокСистема сохраняет причину и область применения.
  4. ИзменениеПроверенный урок попадает в правило или инструмент.
  5. Повторная проверкаСледующий проход проверяет новое поведение.

У петли два источника обратной связи. Первый — проверка работы до действия: корректны ли расчёты, подтверждена ли фактура, разрешена ли операция. Второй — результат после действия: появились ли оплаты, изменились ли позиции, выдержала ли гипотеза окно оценки.

Критик помогает исправить текущую работу. Learning loop переносит найденное исправление в будущие задачи. Если критик каждый день ловит одну и ту же ошибку, а правила остаются прежними, цикл улучшения ещё не замкнулся.

Гейт делает урок исполняемым: при невыполненном условии действие блокируется. В статье Building effective agents Anthropic описывает цикл, где оценщик проверяет результат, а исполнитель дорабатывает его. Для обучения между запусками к такому циклу нужно добавить сохранение проверенного опыта и его применение в следующей задаче.

Кейс 1. Голиаф: из слепой зоны — в условие остановки

В Голиафе ошибка возникла между источниками данных. Агент делал вывод по отсутствующим заявкам, хотя причиной отсутствия был разрыв разметки. Направление, которое остановили, по восстановленному счёту работало с окупаемостью около 160%.

Урок сформулирован конкретно: отсутствие результата можно признавать только после проверки источников. Теперь для вывода «ноль лидов» сверяются кабинет, аналитика и CRM. Расхождение требует разбора данных до решения о рекламе.

Это изменение способа принимать решения. Оно не гарантирует, что все будущие ошибки исчезнут. Но у следующего прохода появляется проверка того класса ошибки, который уже обошёлся нам деньгами.

Пример записи урока по этому кейсу:

Событие
Кампания остановлена по невидимым для агента продажам.
Причина
Рекламная разметка не сшилась с вебинарной платформой.
Правило
Перед признанием нуля проверить кабинет, аналитику и CRM.
Граница
При расхождении источников отложить денежное решение.
Проверка
Подать данные со сломанной склейкой: система должна обнаружить разрыв.

Карточка описывает структуру урока. Отдельная проверка должна показать, что правило действительно исполняется в следующем проходе.

Кейс 2. Прометей: публикация возвращается на замер

В Прометее обратная связь приходит с разной скоростью. Критик может обнаружить ошибку в тексте сразу. Поисковая гипотеза требует времени: для изменения заголовка предусмотрен повторный замер через 21 день.

У гипотезы сохраняются страница, изменение, исходное состояние и дата проверки. После окна можно выяснить, что произошло с выбранной метрикой. Успех даёт основание продолжать исследование, неудача — пересмотреть гипотезу. Один рост позиции ещё не превращается в универсальное правило для всего блога.

Здесь Learning loop связывает исследование, публикацию и следующий вопрос к данным. Чтобы опыт действительно использовался дальше, вывод должен попасть в рабочие инструкции или условия выбора следующей гипотезы. Запись результата в журнал — промежуточный шаг.

Другой пример изменения системы — перестройка конвейера в сентябре. Сбор данных и повторяемые проверки передали скриптам, дорогая модель осталась смысловым судьёй. Это решение меняет архитектуру будущих проходов. Оно принято человеком; кейс не доказывает, что Прометей сам переписал свою архитектуру.

Поисковая обратная связь требует осторожности. На позиции влияют спрос, сезонность и изменения поисковика. Полезный урок сохраняет окно, условия и ограничения, чтобы случайный результат не стал правилом на весь корпус.

Кейс 3. Соломон: отвергнутый вывод сохраняет рамку счёта

Соломон работает с первичными данными. Один из разборов показал: ключ склейки теряет часть заказов. Другие проверки обнаруживали подмену оплат завершёнными сделками и смешение новых людей с повторными регистрациями.

В подготовке к выступлению проверили утверждение «Соломон повысил ARPL в четыре раза». Оно не воспроизводилось по маркетингу целиком и было отвергнуто. Полезный результат этой работы — сохранённое различие между рекламным каналом, всей базой и выбранной когортой.

Урок для следующих расчётов: заранее указать, каких людей считаем, за какой период и из какого реестра берём деньги. Значимый денежный вывод сверить вторым маршрутом. Эти требования входят в машиночитаемый маркетинг и должны сопровождать новые вопросы к базе.

Обучение здесь оценивается по качеству последующих расчётов: повторяет ли система подмену рамки, замечает ли расхождение, может ли воспроизвести число. Отдельный прирост выручки от аналитика в этом кейсе не измерен.

А где здесь Трансграничный монстр

Монстр — локальная программа подготовки данных, у которой есть правила обработки и тесты. Исправление детектора и добавление проверки разработчиком — обычное развитие программы. Оно может обеспечивать проверку урока в общем контуре, но само по себе не означает, что Монстр автономно обучается.

Этот пример помогает удержать границу термина: самообучающейся мы называем систему, в которой обратная связь организованно влияет на последующую работу. Для каждого случая нужно показать, кто сформулировал урок, кто его принял и как он применяется.

Почему память нужно разбирать

Сохранить весь разговор легко. Найти в нём полезное правило через месяц сложнее. Рабочая память должна отделять наблюдение от гипотезы, а подтверждённое правило — от частного случая.

У урока нужны источник, дата, область применения, предложенное изменение и статус проверки. Если две записи противоречат друг другу, нужно разобраться с их условиями. Если правило устарело, убрать его из действующих инструкций и сохранить историю изменения.

В нашей схеме уроки объединяются и проходят ревизию человеком. Иначе память растёт, а агент получает всё больше несовместимых требований. Роль оператора — поддерживать связность правил и принимать изменения, которые влияют на полномочия системы.

Вычисления и жёсткие запреты лучше переносить в инструменты. Смысловые наблюдения — хранить с контекстом. Так правило «не делай вывод на сломанной склейке» получает техническую проверку, а наблюдение о поисковом заголовке сохраняет конкретную страницу и окно.

Как проверить, что система учится

После изменения нужно вернуться к ситуации, на которой система ошиблась, и проверить новое поведение. Затем посмотреть, не испортило ли правило соседние случаи.

Успешное исправление одной ошибки показывает, что конкретный урок работает. Для утверждения об общем росте качества нужны повторные замеры на сопоставимых задачах. В этой статье мы описываем механизм и примеры изменений; единого измеренного процента улучшения всего контура пока не заявляем.

Начать можно с последней дорогой ошибки. Зафиксировать её причину, изменить одну проверку и повторить ситуацию. Когда изменение используется в следующем запуске и его результат виден, появляется рабочая петля обучения.

Как Learning loop связана с методом

Машиночитаемый маркетинг делает доступными данные, определения, правила и результаты действий. Learning loop возвращает проверенный результат в эти правила. Благодаря этому контур может накапливать опыт между запусками.

Практика разобрана в Голиафе, Прометее и Соломоне. Общая архитектура — в кейсе трансформации отдела маркетинга.


Продолжение — в канале

Полные кейсы и методология собраны на этом сайте. В канале обсуждаем новые разборы и промежуточные наблюдения. Про метод — в методологии.

Читать канал@vkurzemnek