Skip to main content

Loop Engineering вместо Prompt Engineering от создателей басен и мифов Пока мы ждём решения вопросиков между Anthropic и чиновниками, обратимся к вечному - методологии циклического инжениринга.Вместе с выходом самих моделей Mythos и Fable, создатели harness от Anthropic поделились новым паттерном для работы с кодинг агентами. Назвали его Loop Engineering он преподносится, как развитие Prompt Engineering, но дополняет Context Engineering.На самом деле, это схожий концепт с подходами Карпаты по самоусовершенствованию агентов за счёт обратной связи среды. Кстати, почему это работает? Если вспомнить, модели R1 в тех.репортах от команды DeepSeek используют RLVR для обучения. Они помещаются в среду, где награда получается автоматом, без внешних моделек. И в качестве такой среды, для примера, брался компилятор. Т.е. изначально LMку тюнили под такое поведение с RL. Но вернемся к тому, как это нативно встраивается в harness. Веделяются три столпа подхода:1. Self-correction loop. Модель выполняет действие → получает обратную связь от окружения (например, код не прошел тест) → самоисправляется → и повторяет цикл, пока не удовлетворит заданному критерию (например, все тесты не будут пройдены). Все знакомо и напоминает ReAct цикл: получил задачу, сделал план, провел действие, оценил че там наделал, скорректировал план, и по кругу. Но авторы снова тут поднимают проблему ReAct подхода, как эхо камеры - тк происходит самооценка, а модель, по признанию самих же авторов, сама себя оценивает плохо (см. overconfidence bias). Мы кстати не раз поднимали эту тему в данном канале и обращались к соседям по цеху. Поэтому вводятся, как оценки от среды (компиляторы, юнит-тесты и тп), так и саб агенты в лице иных моделей оценщиков. 2. Память. Модуль, который позволяет знаниям накапливаться между этапами и даже сессиями, и использоваться в будущем. Модель может записывать в память, как md-файлы в репозитории: извлеченные уроки, удачные паттерны и даже неудачные ходы. Помню, что последнее делал Manus. В следующих сессиях она может обратиться к этой памяти, чтобы начать работу с более высокого уровня, не повторяя прошлых ошибок. Этот механизм реализует пятиэтапный подход: fail (ошибся) → investigate (исследование причин ошибки) → verify (проверка гипотезы почему ошибся) → distill (запись верного суждения об этом в память) → consult (обращение к памяти за ранее сохраненными ходами). В целом, напоминает наше поведение. Произвёл ошибку, почесал репу, понял почему ошибся, запомнил, как надо и не надо делать, пошёл дальше, когда столкнулся с подобной ситуацией, уже научен что и как. 3. Рубрики и цель. В целом, не нативное понимание этого у авторов, по факту рубрика - оценка, цель это задача. Но тут переходят от оценочного суждения (скор, ранг, лучше/хуже), к четким проверяемым критериям: прошел тесты, без ошибок сборка встала, ответ совпадает и тп. И критерий достижения цели и есть рубрики.И напоследок, совет дня. Инвестируйте не в "супер-промптеров", а в инженеров по проектированию агентных систем. Это стратегический сдвиг от эксплуатации к архитектуре. При этом основными скиллами становятся как контекст, так и loop инженеринг (для сложных многошаговых задач), а промптингу остаются простые, быстрые, одношаговые сценарии.Источник помимо x.

  1. @dealerAI TG

    Loop Engineering вместо Prompt Engineering от создателей басен и мифов

    Пока мы ждём решения вопросиков между Anthropic и чиновниками, обратимся к вечному - методологии циклического инжениринга.

    Вместе с выходом самих моделей Mythos и Fable, создатели harness от Anthropic поделились новым паттерном для работы с кодинг агентами. Назвали его Loop Engineering он преподносится, как развитие Prompt Engineering, но дополняет Context Engineering.

    На самом деле, это схожий концепт с подходами Карпаты по самоусовершенствованию агентов за счёт обратной связи среды. Кстати, почему это работает? Если вспомнить, модели R1 в тех.репортах от команды DeepSeek используют RLVR для обучения. Они помещаются в среду, где награда получается автоматом, без внешних моделек. И в качестве такой среды, для примера, брался компилятор. Т.е. изначально LMку тюнили под такое поведение с RL.

    Но вернемся к тому, как это нативно встраивается в harness.

    Веделяются три столпа подхода:

    1. Self-correction loop. Модель выполняет действие → получает обратную связь от окружения (например, код не прошел тест) → самоисправляется → и повторяет цикл, пока не удовлетворит заданному критерию (например, все тесты не будут пройдены). Все знакомо и напоминает ReAct цикл: получил задачу, сделал план, провел действие, оценил че там наделал, скорректировал план, и по кругу. Но авторы снова тут поднимают проблему ReAct подхода, как эхо камеры - тк происходит самооценка, а модель, по признанию самих же авторов, сама себя оценивает плохо (см. overconfidence bias).
    Поэтому вводятся, как оценки от среды (компиляторы, юнит-тесты и тп), так и саб агенты в лице иных моделей оценщиков.

    2. Память. Модуль, который позволяет знаниям накапливаться между этапами и даже сессиями, и использоваться в будущем. Модель может записывать в память, как md-файлы в репозитории: извлеченные уроки, удачные паттерны и даже неудачные ходы. Помню, что последнее делал Manus. В следующих сессиях она может обратиться к этой памяти, чтобы начать работу с более высокого уровня, не повторяя прошлых ошибок. Этот механизм реализует пятиэтапный подход: fail (ошибся) → investigate (исследование причин ошибки) → verify (проверка гипотезы почему ошибся) → distill (запись верного суждения об этом в память) → consult (обращение к памяти за ранее сохраненными ходами). В целом, напоминает наше поведение. Произвёл ошибку, почесал репу, понял почему ошибся, запомнил, как надо и не надо делать, пошёл дальше, когда столкнулся с подобной ситуацией, уже научен что и как.

    3. Рубрики и цель. В целом, не нативное понимание этого у авторов, по факту рубрика - оценка, цель это задача. Но тут переходят от оценочного суждения (скор, ранг, лучше/хуже), к четким проверяемым критериям: прошел тесты, без ошибок сборка встала, ответ совпадает и тп. И критерий достижения цели и есть рубрики.

    И напоследок, совет дня. Инвестируйте не в "супер-промптеров", а в инженеров по проектированию агентных систем. Это стратегический сдвиг от эксплуатации к архитектуре. При этом основными скиллами становятся как контекст, так и loop инженеринг (для сложных многошаговых задач), а промптингу остаются простые, быстрые, одношаговые сценарии.

    Источник помимо x.
    🔥 22 ❤️ 8 👌 4