Как оценить качество ответа ИИ?

ТехИнсайдерHi-Tech

Зачем в России сделали первый бенчмарк для мультимодальной нейросети

52d8cf140941dd38676322379bedf1d8_ce_1987x1325x6x0.jpg
Magnific

Нейросеть можно попросить прочитать скан договора, найти в нем сумму сделки и назвать генерального директора — и она ответит. Проблема в том, что она с той же готовностью ответит и в том случае, если половину придумала: на глаз хорошую галлюцинацию не отличить от правильного ответа. Модель ведь не читает документ в человеческом смысле, а предсказывает наиболее вероятное продолжение.

Бизнес уже вовсю доверяет нейросетям чтение счетов, договоров и заявок, а инструмента, который отличал бы одно от другого, в России не было. Разработчики MWS AI решили эту неопределенность снять — и сделали MWS Vision Bench, первый в стране открытый бенчмарк для проверки мультимодальных моделей на реальных документах.

Почему нельзя было взять готовый тест

Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.

Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.

«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».

Авторизуйтесь, чтобы продолжить чтение. Это быстро и бесплатно.

Регистрируясь, я принимаю условия использования

Открыть в приложении