prompt-eng
Словарь ↗Self-Refine
Self-Refine («самоулучшение») — итеративный цикл, в котором одна и та же модель генерирует ответ, критикует собственный вывод и переписывает его с учётом этой критики, повторяя до удовлетворительного результата или лимита шагов. Главное в методе (Madaan et al., 2023): не нужны ни дообучение, ни внешняя модель вознаграждения, ни участие человека — одна LLM в трёх запросах играет автора, рецензента и редактора. Приём чаще помогает в открытой генерации — код, черновики, реплики диалога, — где первый вариант неплох, но содержит устранимые огрехи, которые модель замечает, если её попросить перечитать. Для SaaS-разработчиков это дешёвый рычаг качества: после генерации добавьте шаг «перечисли конкретные проблемы этого вывода, затем выдай улучшенную версию». Две оговорки: прирост неравномерен, после пары раундов он выходит на плато или даже падает; и каждая итерация стоит токенов и задержки. Поэтому ограничивайте цикл (обычно один-два прохода) и по возможности проверяйте на своём наборе оценки, действительно ли улучшенный вывод обходит исходный.
Похожие термины