Зачем в России сделали первый бенчмарк для мультимодальной нейросети
Нейросеть можно попросить прочитать скан договора, найти в нем сумму сделки и назвать генерального директора — и она ответит. Проблема в том, что она с той же готовностью ответит и в том случае, если половину придумала: на глаз хорошую галлюцинацию не отличить от правильного ответа. Модель ведь не читает документ в человеческом смысле, а предсказывает наиболее вероятное продолжение.
Бизнес уже вовсю доверяет нейросетям чтение счетов, договоров и заявок, а инструмента, который отличал бы одно от другого, в России не было. Разработчики MWS AI решили эту неопределенность снять — и сделали MWS Vision Bench, первый в стране открытый бенчмарк для проверки мультимодальных моделей на реальных документах.
Почему нельзя было взять готовый тест
Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.
Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.
«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».
