Современные большие языковые модели (БЯМ) вышли за рамки простых языковых задач, демонстрируя впечатляющие возможности ответов на вопросы в контексте с использованием новых методов подсказки, инициированных пользователем. Однако эти модели не могут обеспечить оценку точности своих ответов, и, как ранее сообщала компания Synced, они испытывают трудности при решении математических задач и задач на рассуждение.
В новой работе MathPrompter: Математические рассуждения с использованием больших языковых моделей» команда Microsoft Research представляет MathPrompter — новый подход, использующий методы подсказки цепочки мыслей (CoT) для улучшения работы LLM в задачах на математические рассуждения и повышения уверенности в своих предсказаниях.
Эта работа была вдохновлена тем, как люди решают математические вопросы: разбивают задачу на несколько шагов и используют различные методы для проверки каждого шага. Чтобы имитировать этот процесс для решения подобных задач рассуждения в LLM, исследователи обратились к методам подсказки «нулевого выстрела», цепочки мыслей (CoT).

Конвейер MathPrompter состоит из четырех этапов. Задается вопрос: 1) генерируется алгебраический шаблон, заменяя числовые записи переменными; 2) LLM подается несколько математических подсказок, которые могут решить сгенерированное алгебраическое выражение аналитически различными способами; 3) аналитические решения оцениваются путем присвоения алгебраическому выражению нескольких случайных значений; и 4) к решениям аналитических функций применяется тест на статистическую значимость, чтобы найти «консенсус» и вывести окончательное решение.
Таким образом, MathPrompter использует подходы к проверке решений, подобные тем, которые используются людьми — соответствие известным результатам, мультипроверка, перекрестная проверка и проверка вычислений — для повышения доверия к сгенерированным ответам.
В своем эмпирическом исследовании команда оценила MathPrompter на наборе данных MultiArith — наборе математических задач, разработанном для проверки способностей моделей машинного обучения к сложным арифметическим операциям и рассуждениям.
В ходе экспериментов модель MathPrompter на 175B достигла точности 92,5 процента, что значительно лучше, чем 78,7 процента у модели SOTA аналогичного размера. MathPrompter также достигла производительности, сравнимой с моделями SOTA с несколькими выстрелами-CoT и более крупной моделью PaLM с нулевым выстрелом-CoT с 540B параметрами, демонстрируя свою способность значительно улучшить производительность LLM как при нулевом выстреле, так и при нескольких выстрелах. В дальнейшие планы команды входит включение дополнительных подсказок в MathPrompter и тестирование его производительности на других наборах данных.








