• A
  • A
  • A
  • АБB
  • АБB
  • АБB
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Студенты мастерской Ozon Tech и НИУ ВШЭ представили результаты проектов по безопасности языковых моделей

В московском офисе Ozon состоялась предзащита проектов совместной студенческой мастерской Ozon Tech и НИУ ВШЭ МИЭМ. Девять студентов представили промежуточные результаты двух проектов в области безопасности больших языковых моделей. Участники разрабатывают инструменты для автоматизированного формирования и проверки наборов данных, моделирования prompt injection (искажённых запросов) и многошаговых состязательных сценариев.

Студенты мастерской Ozon Tech и НИУ ВШЭ представили результаты проектов по безопасности языковых моделей

Мастерская стартовала в апреле 2026 года. Студенты работают над реальными индустриальными задачами под руководством экспертов Ozon Tech и преподавателей НИУ ВШЭ. Проекты от компании сопровождают Никита Губорев, старший инженер по информационной безопасности и Эмма Нехорошева, инженер по информационной безопасности. Эксперты со стороны МИЭМ – сотрудники Центра программных разработок и цифровых сервисов, исследователи Алексей Солдатов и Роман Просвирнин. Предзащита стала промежуточным этапом, на котором команды продемонстрировали прототипы, представили выбранные методы и обсудили дальнейшее развитие решений.

Кирилл Мякишев

Директор по информационной безопасности Ozon

«Мастерские технологических компаний в вузах дают студентам важное преимущество — работу над реальными задачами, практические кейсы для портфолио и понимание, как устроена разработка в крупной компании. Именно такой опыт получают участники мастерской по кибербезопасности Ozon Tech и МИЭМ ВШЭ, которую мы запустили в апреле 2026 года. И сегодня уже видим промежуточные результаты — на предзащите в московском офисе Ozon девять студентов показали, чего удалось добиться за это время по двум направлениям, связанным с безопасностью больших языковых моделей. Сегодня ребята показали свои наработки, прототипы моделей и методы работы, после чего им удалось сформировать дальнейшие шаги к финализации проектов. А эксперты Ozon Tech продолжают сопровождать студентов на всем протяжении проекта, погружают участников в настоящие продуктовые задачи и делятся опытом из собственной практики. Для нас это станет еще одним шагом к развитию IT-сообщества в стране и поможет сформировать кадровый резерв из талантливой молодежи», — отметил Кирилл Мякишев.

Первый проект — «Моделирование prompt injection и искажённых запросов с помощью нецензурируемых LLM» — посвящён автоматизированному созданию сложных запросов для проверки устойчивости языковых моделей. Разрабатываемая система преобразует исходный набор промптов в многошаговые цепочки атак, которые имитируют действия злоумышленника: контекстные и ролевые искажения, последовательную эскалацию запроса и попытки обойти установленные ограничения.

В прототипе пользователь может указать предметную область, выбрать тип атаки и уровень сложности проверочного сценария. Для реализации решения команда сформировала стартовый набор промптов, исследовала открытые языковые модели для синтеза новых запросов и подготовила методы оценки полученных результатов. Автоматизация этих этапов должна упростить масштабирование испытаний и сделать проверку моделей воспроизводимой. Также были исследованы методы обфускации вредоносных промптов и их влияние на поведение целевых LLM. Отдельной задачей стало исследование метрик уникальности сгенерированных промптов. Понимание насколько каждый следующий сгенерированный промпт уникален позволяет поддерживать высокое разнообразие тестового набора данных.

Презентация проекта

Второй проект — «Автоматизация формирования и проверки наборов данных для обеспечения соответствия ответов языковых моделей политике компании» — связан с управлением поведением LLM в прикладных сервисах. Открытые модели могут воспроизводить установки и ограничения, заданные их разработчиками, и не всегда учитывать требования конкретной компании и российского законодательства. Поэтому команде предстояло создать механизм, который помогает формировать обучающие и тестовые данные с учётом политики контента, запрещённых тем и недопустимых форм поведения модели.

Прототип разрабатывается для трёх сценариев: генеративного поиска товаров, автоматического формирования ответов на отзывы покупателей и чат-бота поддержки клиентов. Студенты собрали стартовый датасет промптов, сравнили открытые языковые модели для синтеза новых запросов и подготовили промпты для генерации данных и оценки ответов.

Презентация проекта

Два проекта решают взаимосвязанные задачи. Первый позволяет создавать усложнённые атакующие запросы и проверять устойчивость LLM к попыткам обхода ограничений. Второй формирует данные и инструменты оценки, необходимые для контроля соответствия ответов корпоративной политике. Вместе эти решения закладывают основу воспроизводимого контура тестирования языковых моделей перед их использованием в продуктах компании.

Антон Сергеев

Директор Центра программных разработок и цифровых сервисов МИЭМ,

руководитель мастерской от НИУ ВШЭ

«Мы ведем исследования и разработки области безопасного искусственного интеллекта уже несколько лет. Результаты наших научных и технологических изысканий – не только новые методы, алгоритмы, но и конкретные продуктовые решения. В МИЭМ ВШЭ создана, например, система для сканирования моделей ИИ на киберустойчивость и крупнейшая база дипфейков для моделирования атак на системы биометрической идентификации. Партнерство с Ozon Tech для нас крайне ценно, потому что даёт возможность проверить решения и концепции обеспечения безопасности ИИ на реальных наборах данных и бизнес-сценариях. А для студентов Вышки это важный этап старта карьеры как специалистов по безопасности искусственного интеллекта. Это большая удача -- начать развиваться как профессионал в такой высокотехнологичной компании как Ozon Tech, уделяющей большое внимание развитию кадров», — подчеркнул Антон Сергеев.

После предзащиты команды продолжат тестирование и доработку прототипов с учётом полученной обратной связи. Разработанные инструменты будут применяться для системной проверки безопасности и управляемости языковых моделей в практических сценариях Ozon Tech.