Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Зачем в России сделали первый бенчмарк для мультимодальной нейросети

Дата публикации: 30-09-2026 04:00:00

Почему нельзя было взять готовый тест Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.

Основное содержимое страницы с новостью.

Зачем в России сделали первый бенчмарк для мультимодальной нейросети

Нейросеть можно попросить прочитать скан договора, найти в нем сумму сделки и назвать генерального директора — и она ответит. Проблема в том, что она с той же готовностью ответит и в том случае, если половину придумала: на глаз хорошую галлюцинацию не отличить от правильного ответа. Модель ведь не читает документ в человеческом смысле, а предсказывает наиболее вероятное продолжение.

Теги:

Зачем в России сделали первый бенчмарк для мультимодальной нейросети

Magnific

Бизнес уже вовсю доверяет нейросетям чтение счетов, договоров и заявок, а инструмента, который отличал бы одно от другого, в России не было. Разработчики MWS AI решили эту неопределенность снять — и сделали MWS Vision Bench, первый в стране открытый бенчмарк для проверки мультимодальных моделей на реальных документах.

Почему нельзя было взять готовый тест

Международные бенчмарки для такой задачи существуют — например, OCRBench, AI2D или MMMU. Но один заточен под английский и китайский языки, другой держит в себе довольно примитивный набор диаграмм еще десятых годов, а один из самых цитируемых — HallusionBench — вообще не про документы, а про визуальные иллюзии.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Для рынка, где нужно оценивать модель на русскоязычных договорах, чеках, схемах и рукописных пометках, готового инструмента не было.

«Наша задача была не мультимодальность ради мультимодальности, а решение проблем бизнеса, — объясняет руководитель центра разработки больших языковых моделей MWS AI Валентин Малых. — У нас есть кейсы, близкие бизнесу: работа с документами, графиками, чеками. Это то, с чем компании реально сталкиваются каждый день».

В итоге получился набор из 800 изображений и 2580 заданий пяти типов:

  • постраничное распознавание текста;
  • перевод страницы в структурированный текст;
  • поиск нужных координат на изображении;
  • извлечение конкретных данных из документа;
  • ответы на вопросы по содержанию.

Продолжение ниже

Видео

Продолжение

Половина заданий в открытом доступе, вторая половина — закрытый тест, по которому и сравнивают модели.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Как измерить то, что нельзя пощупать

Бенчмарк не оценивает, «поняла» ли нейросеть документ в человеческом смысле cлова. Вместо этого ей задают предельно конкретные вопросы: кто указан директором в этом договоре, какая сумма в графе «итого». Ответ верный — модель, скорее всего, справилась. Неверный — где-то в цепочке от картинки к смыслу что-то сломалось, а где именно, бенчмарку не важно.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

«Бенчмарк — это линейка, — говорит Валентин Малых. — Представьте прыжки в длину: чтобы оценить результат, не нужно разбираться в биомеханике толчка, достаточно измерить расстояние от планки до отпечатка в песке». Дать модели рекомендации, что именно исправить, бенчмарк не может и не должен — это задач разработчиков, которые смотрят на результаты и решают, чему модель нужно доучиться.

Здесь есть тонкость: там, где алгоритм пока не может проверить ответ сам — в сложных вопросах на понимание текста, — точкой отсчета становится человек, эксперт-разметчик, чья оценка и есть эталон. Валентин Малых сравнивает эту логику с идеями философов Нового времени: чтобы что-то улучшить, нужно сначала это измерить, а измерительным прибором в конечном счете оказывается сам человек и его суждение о том, что правильно.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

«Мы, разработчики моделей, на практике каждый день опираемся на вещи, которые лежат глубоко в философии, просто обычно этого не замечаем», — говорит Валентин Малых.

Разворачивает эту мысль он не только в разговоре о продукте — в октябре Малых примет участие в дискуссии о философии измерения на конференции клуба Quercus «Философия в ответе», уже безотносительно к конкретному бенчмарку.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Откуда берутся галлюцинации

Отдельный вопрос — сами галлюцинации. «Нейросеть галлюцинирует все время, просто иногда удачно, поэтому мы этого не замечаем, — объясняет эксперт. — Модель учат предсказывать следующее слово, а раз она не знает наверняка, какое слово правильное, ей приходится угадывать. Угадывание — это и есть галлюцинация, просто у нее есть точные попадания, а есть промахи».

Отличить, что именно пошло не так, — нейросеть не разглядела текст на плохом скане или придумала факт, которого в документе не было, — бенчмарку помогает конкретика вопросов: если модель не может назвать директора компании из читаемого договора, дело не в качестве скана.

Российские разработчики уже собрали для себя отдельную категорию таких ошибок и используют ее, чтобы оценивать модели по новой шкале — насколько именно они склонны додумывать за документ.

У бенчмарка при этом есть врожденный срок годности: он статичен, а значит, рано или поздно его данные так или иначе просочатся в обучающие выборки будущих моделей — и он перестанет отличать хорошие модели от слабых. Тогда его придется обновлять заново.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Валентин Малых убежден: привычка сперва измерить, а потом улучшать — не техническая деталь, а способ мышления, которому стоит учиться любому инженеру.


Пока нейросети учатся не понимать, а предсказывать, вопрос, что именно мы измеряем, когда оцениваем ИИ, остается открытым.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Разработчики из 91 страны представили проекты ИИ02027-09-2026
2Железная рука: к чему приведет соперничество Пекина и Вашингтона в сфере ИИ01026-09-2026
3ИИ из коробки: сервисы распознавания документов IDP09.4928-09-2026
4Визуальные токены05.7624-09-2026
5DeepSeek и GigaChat вместо учебников: российские учителя массово переходят на нейросети06.628-09-2026
6DeepSeek и GigaChat вместо учебников: российские учителя массово переходят на нейросети06.628-09-2026
7"Колди" тестирует ИИ для ценообразования и архитектурных концепций08.9829-09-2026
8Externe Benchmarks: Claude Opus 5.5 überholt Astra von OpenAI und Fable 5.1021.4225-09-2026
9ИИ за вчера: космос, «Энигма» и агенты ИИ готовят к ...18.6727-09-2026
10Копия лучше оригинала: как 3D-печать совершенствует работу промышленных машин08.1630-09-2026

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 8.94. Источник: www.popmech.ru.