Почему нельзя было взять готовый тест Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.
Нейросеть можно попросить прочитать скан договора, найти в нем сумму сделки и назвать генерального директора — и она ответит. Проблема в том, что она с той же готовностью ответит и в том случае, если половину придумала: на глаз хорошую галлюцинацию не отличить от правильного ответа. Модель ведь не читает документ в человеческом смысле, а предсказывает наиболее вероятное продолжение.
Теги:

Magnific
Бизнес уже вовсю доверяет нейросетям чтение счетов, договоров и заявок, а инструмента, который отличал бы одно от другого, в России не было. Разработчики MWS AI решили эту неопределенность снять — и сделали MWS Vision Bench, первый в стране открытый бенчмарк для проверки мультимодальных моделей на реальных документах.
Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.
Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.
«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».
В итоге получился набор из 800 изображений и 2580 заданий пяти типов:
Продолжение ниже
Видео
Продолжение
Половина заданий в открытом доступе, вторая половина — закрытый тест, по которому и сравнивают модели.
Бенчмарк не оценивает, «поняла» ли нейросеть документ в человеческом смысле cлова. Вместо этого ей задают предельно конкретные вопросы: кто указан директором в этом договоре, какая сумма в графе «итого». Ответ верный — модель, скорее всего, справилась. Неверный — где-то в цепочке от картинки к смыслу что-то сломалось, а где именно, бенчмарку не важно.
«Бенчмарк — это линейка, — говорит Валентин Малых. — Представьте прыжки в длину: чтобы оценить результат, не нужно разбираться в биомеханике толчка, достаточно измерить расстояние от планки до отпечатка в песке». Дать модели рекомендации, что именно исправить, бенчмарк не может и не должен — это задач разработчиков, которые смотрят на результаты и решают, чему модель нужно доучиться.
Здесь есть тонкость: там, где алгоритм пока не может проверить ответ сам — в сложных вопросах на понимание текста, — точкой отсчета становится человек, эксперт-разметчик, чья оценка и есть эталон. Валентин Малых сравнивает эту логику с идеями философов Нового времени: чтобы что-то улучшить, нужно сначала это измерить, а измерительным прибором в конечном счете оказывается сам человек и его суждение о том, что правильно.
«Мы, разработчики моделей, на практике каждый день опираемся на вещи, которые лежат глубоко в философии, просто обычно этого не замечаем», — говорит Валентин Малых.
Разворачивает эту мысль он не только в разговоре о продукте — в октябре Малых примет участие в дискуссии о философии измерения на конференции клуба Quercus «Философия в ответе», уже безотносительно к конкретному бенчмарку.
Отдельный вопрос — сами галлюцинации. «Нейросеть галлюцинирует все время, просто иногда удачно, поэтому мы этого не замечаем, — объясняет эксперт. — Модель учат предсказывать следующее слово, а раз она не знает наверняка, какое слово правильное, ей приходится угадывать. Угадывание — это и есть галлюцинация, просто у нее есть точные попадания, а есть промахи».
Отличить, что именно пошло не так, — нейросеть не разглядела текст на плохом скане или придумала факт, которого в документе не было, — бенчмарку помогает конкретика вопросов: если модель не может назвать директора компании из читаемого договора, дело не в качестве скана.
Российские разработчики уже собрали для себя отдельную категорию таких ошибок и используют ее, чтобы оценивать модели по новой шкале — насколько именно они склонны додумывать за документ.
У бенчмарка при этом есть врожденный срок годности: он статичен, а значит, рано или поздно его данные так или иначе просочатся в обучающие выборки будущих моделей — и он перестанет отличать хорошие модели от слабых. Тогда его придется обновлять заново.
Валентин Малых убежден: привычка сперва измерить, а потом улучшать — не техническая деталь, а способ мышления, которому стоит учиться любому инженеру.
Пока нейросети учатся не понимать, а предсказывать, вопрос, что именно мы измеряем, когда оцениваем ИИ, остается открытым.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Разработчики из 91 страны представили проекты ИИ | 0 | 20 | 27-09-2026 |
| 2 | Железная рука: к чему приведет соперничество Пекина и Вашингтона в сфере ИИ | 0 | 10 | 26-09-2026 |
| 3 | ИИ из коробки: сервисы распознавания документов IDP | 0 | 9.49 | 28-09-2026 |
| 4 | Визуальные токены | 0 | 5.76 | 24-09-2026 |
| 5 | DeepSeek и GigaChat вместо учебников: российские учителя массово переходят на нейросети | 0 | 6.6 | 28-09-2026 |
| 6 | DeepSeek и GigaChat вместо учебников: российские учителя массово переходят на нейросети | 0 | 6.6 | 28-09-2026 |
| 7 | "Колди" тестирует ИИ для ценообразования и архитектурных концепций | 0 | 8.98 | 29-09-2026 |
| 8 | Externe Benchmarks: Claude Opus 5.5 überholt Astra von OpenAI und Fable 5.1 | 0 | 21.42 | 25-09-2026 |
| 9 | ИИ за вчера: космос, «Энигма» и агенты ИИ готовят к ... | 1 | 8.67 | 27-09-2026 |
| 10 | Копия лучше оригинала: как 3D-печать совершенствует работу промышленных машин | 0 | 8.16 | 30-09-2026 |