MathPrompter от Microsoft значительно повышает производительность LLM при выполнении заданий на математическое мышление

ИИ и нейросети в финансах

Современные большие языковые модели (БЯМ) вышли за рамки простых языковых задач, демонстрируя впечатляющие возможности ответов на вопросы в контексте с использованием новых методов подсказки, инициированных пользователем. Однако эти модели не могут обеспечить оценку точности своих ответов, и, как ранее сообщала компания Synced, они испытывают трудности при решении математических задач и задач на рассуждение.

В новой работе MathPrompter: Математические рассуждения с использованием больших языковых моделей» команда Microsoft Research представляет MathPrompter — новый подход, использующий методы подсказки цепочки мыслей (CoT) для улучшения работы LLM в задачах на математические рассуждения и повышения уверенности в своих предсказаниях.

Эта работа была вдохновлена тем, как люди решают математические вопросы: разбивают задачу на несколько шагов и используют различные методы для проверки каждого шага. Чтобы имитировать этот процесс для решения подобных задач рассуждения в LLM, исследователи обратились к методам подсказки «нулевого выстрела», цепочки мыслей (CoT).

Конвейер MathPrompter состоит из четырех этапов. Задается вопрос: 1) генерируется алгебраический шаблон, заменяя числовые записи переменными; 2) LLM подается несколько математических подсказок, которые могут решить сгенерированное алгебраическое выражение аналитически различными способами; 3) аналитические решения оцениваются путем присвоения алгебраическому выражению нескольких случайных значений; и 4) к решениям аналитических функций применяется тест на статистическую значимость, чтобы найти «консенсус» и вывести окончательное решение.

Таким образом, MathPrompter использует подходы к проверке решений, подобные тем, которые используются людьми — соответствие известным результатам, мультипроверка, перекрестная проверка и проверка вычислений — для повышения доверия к сгенерированным ответам.

В своем эмпирическом исследовании команда оценила MathPrompter на наборе данных MultiArith — наборе математических задач, разработанном для проверки способностей моделей машинного обучения к сложным арифметическим операциям и рассуждениям.

В ходе экспериментов модель MathPrompter на 175B достигла точности 92,5 процента, что значительно лучше, чем 78,7 процента у модели SOTA аналогичного размера. MathPrompter также достигла производительности, сравнимой с моделями SOTA с несколькими выстрелами-CoT и более крупной моделью PaLM с нулевым выстрелом-CoT с 540B параметрами, демонстрируя свою способность значительно улучшить производительность LLM как при нулевом выстреле, так и при нескольких выстрелах. В дальнейшие планы команды входит включение дополнительных подсказок в MathPrompter и тестирование его производительности на других наборах данных.

Дисклеймер: Материалы сайта cb-dc.ru носят исключительно информационный характер и не являются финансовым советом, инвестиционной рекомендацией или призывом к совершению каких-либо финансовых операций. Перед принятием инвестиционных решений проконсультируйтесь с квалифицированным финансовым советником. Инвестиции в криптовалюты и цифровые активы сопряжены с высоким уровнем риска.
Оцените статью
CBDC
Добавить комментарий