Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Нейросети на скрепах // Бизнес представил первые духовно-нравственные тесты для ИИ

Дата публикации: 16-08-2026 22:34:03

«Яндекс» представил правительству концепцию набора тестовых заданий и эталонных данных для тестирования ИИ-систем на предмет их соответствия духовно-нравственным ценностям. Проект пока находится на стадии концепции, на многие вопросы — будут ли тесты общедоступными или закрытыми, кто будет определять их содержание, и т.д. — пока ответа нет.

Основное содержимое страницы с новостью.

«Яндекс» представил правительству концепцию набора тестовых заданий и эталонных данных для тестирования ИИ-систем на предмет их соответствия духовно-нравственным ценностям. Проект пока находится на стадии концепции, на многие вопросы — будут ли тесты общедоступными или закрытыми, кто будет определять их содержание, и т.д. — пока ответа нет.

О том, что «Яндекс» представил концепцию национального датасета — набора тестовых заданий и эталонных данных для бенчмарк-тестирования моделей — на совещании рабочей группы по регулированию и административным барьерам ИИ, прошедшем 13 августа, рассказал “Ъ” источник, близкий к Минцифры, и подтвердил один из участников совещания. По словам источника “Ъ”, это нужно для оценки соответствия ИИ-систем «духу времени и ценностям страны, а также их пригодности для использования в российских условиях».

Бенчмарк представляет собой стандартизированный набор контрольных заданий с эталонными ответами, позволяющий сравнивать качество разных моделей по единым критериям. В отличие от простых тестов, современные бенчмарки проверяют способность модели решать реальные рабочие задачи — например, выгружать данные из базы или собирать отчеты.

Однако на совещании возникли разногласия о степени публичности датасета, говорит источник “Ъ”. По его словам, ФСБ настаивает на закрытом формате, чтобы разработчики не могли легко настроить модели на прохождение тестирования. Однако представители бизнеса заявили, что закрытый формат может быть «несообразно сложным для прохождения и не позволит быстро развивать модели», и предложили все-таки оставить его публичным, говорит он.

По словам источника “Ъ”, в качестве компромисса был предложен комбинированный формат — когда для публичного тестирования и прозрачности может быть использован открытый бенчмарк, а закрытый — для финальной проверки с идентичными тематиками, но с разными формулировками вопросов.

Такой подход должен помочь разработчикам проводить предварительную проверку моделей в лабораториях и обеспечить достоверность итоговой оценки при сохранении ее объективности, считает источник “Ъ”.

Один из участников совещания добавляет, что пока остается открытым вопрос о том, кто будет определять содержание бенчмарка. ИТ-сообщество предлагает создать для этого совместную комиссию с участием органов власти, бизнеса и экспертных организаций, чтобы бенчмарк получился сбалансированным, говорит он.

В аппарате профильного вице-премьера Дмитрия Григоренко “Ъ” сообщили, что в данный момент все предложения проходят обсуждения с отраслью и заинтересованными ведомствами на площадке рабочих групп, а говорить о конкретных решениях преждевременно. В Минцифры сказали, что подзаконные акты к закону об ИИ еще обсуждаются с бизнесом, а ключевая задача — соблюсти интересы отрасли и пользователей, обеспечив соответствие технологий требованиям законодательства. В «Яндексе» и Альянсе ИИ “Ъ” не ответили.

Максут Шадаев, глава Минцифры, май 2024 года:

«Если не будет больших данных, датасетов, то технологии развиваться быстро не будут».

Нейросеть настраивается не так, как обычная программа, объясняет разработчик Kodik «АрхиТех ИИ» Рафаэль Гильмурахманов: «Каждое изменение в одной части поведения модели может повлиять на другую. Релизный цикл у моделей измеряется неделями; слепая пересдача на каждую версию растягивает его в несколько раз».

Закрытые эталонные ответы — это обязательное условие для безопасности модели, поскольку любой публичный бенчмарк рано или поздно «ломается» даже обычным скриптом, говорит бизнес-архитектор проектов ИИ «Авандок» (входит в ГК «КОРУС Консалтинг») Алексей Борщов. Но когда разработчик не знает даже того, какие категории проверяются, в какой пропорции и с какими порогами, то тест становится лотереей, напоминает он.

При этом важно различать два типа заданий, отмечает директор по ИБ GreenData Роман Перепонов: для задач с однозначным ответом — например, программирования или математики — существует четкий эталон. Для оценки же соответствия ценностям такого жесткого эталона быть не может — здесь требуется рубрикаторная или экспертная оценка, говорит он: «Это принципиально разные механики в рамках одного датасета, и требования к их прозрачности должны различаться».

Филипп Крупанин, Алексей Жабин

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1«Яндекс» представил тесты для ИИ на соответствие духовно-нравственным ценностям010.9616-08-2026
2Духовность и нравственность российских ИИ-моделей проверят в испытательных лабораториях016.8913-08-2026
3Российские ИИ будут проверять на духовность и нравственность09.8113-08-2026
4Российские ИИ будут проверять на духовность и нравственность09.8113-08-2026
5Как в России будут регулировать искусственный интеллект для поддержки духовно-нравственных ценностей0709-07-2026
6ГП тестирует искусственный интеллект для оценки коррупционных факторов в нормативных актах0016-11-2021
7В России введут критерии для отечественных моделей ИИ0726-06-2026
8Минцифры подготовило концепцию регулирования искусственного интеллекта0519-08-2025
9В Госдуме рассмотрят проект о маркировке всего ИИ-контента0529-06-2026
10ИИ будут проверять на соответствие «духовным и нравственным ценностям»08.1613-08-2026

Классификация: Наука. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 11.57. Источник: www.kommersant.ru.