Студенты мастерской Ozon Tech и НИУ ВШЭ представили результаты проектов по безопасности языковых моделей
Мастерская стартовала в апреле 2026 года. Студенты работают над реальными индустриальными задачами под руководством экспертов Ozon Tech и преподавателей НИУ ВШЭ. Проекты от компании сопровождают Никита Губорев, старший инженер по информационной безопасности и Эмма Нехорошева, инженер по информационной безопасности. Эксперты со стороны МИЭМ – сотрудники Центра программных разработок и цифровых сервисов, исследователи Алексей Солдатов и Роман Просвирнин. Предзащита стала промежуточным этапом, на котором команды продемонстрировали прототипы, представили выбранные методы и обсудили дальнейшее развитие решений.
Кирилл Мякишев
Директор по информационной безопасности Ozon
«Мастерские технологических компаний в вузах дают студентам важное преимущество — работу над реальными задачами, практические кейсы для портфолио и понимание, как устроена разработка в крупной компании. Именно такой опыт получают участники мастерской по кибербезопасности Ozon Tech и МИЭМ ВШЭ, которую мы запустили в апреле 2026 года. И сегодня уже видим промежуточные результаты — на предзащите в московском офисе Ozon девять студентов показали, чего удалось добиться за это время по двум направлениям, связанным с безопасностью больших языковых моделей. Сегодня ребята показали свои наработки, прототипы моделей и методы работы, после чего им удалось сформировать дальнейшие шаги к финализации проектов. А эксперты Ozon Tech продолжают сопровождать студентов на всем протяжении проекта, погружают участников в настоящие продуктовые задачи и делятся опытом из собственной практики. Для нас это станет еще одним шагом к развитию IT-сообщества в стране и поможет сформировать кадровый резерв из талантливой молодежи», — отметил Кирилл Мякишев.
Первый проект — «Моделирование prompt injection и искажённых запросов с помощью нецензурируемых LLM» — посвящён автоматизированному созданию сложных запросов для проверки устойчивости языковых моделей. Разрабатываемая система преобразует исходный набор промптов в многошаговые цепочки атак, которые имитируют действия злоумышленника: контекстные и ролевые искажения, последовательную эскалацию запроса и попытки обойти установленные ограничения.
В прототипе пользователь может указать предметную область, выбрать тип атаки и уровень сложности проверочного сценария. Для реализации решения команда сформировала стартовый набор промптов, исследовала открытые языковые модели для синтеза новых запросов и подготовила методы оценки полученных результатов. Автоматизация этих этапов должна упростить масштабирование испытаний и сделать проверку моделей воспроизводимой. Также были исследованы методы обфускации вредоносных промптов и их влияние на поведение целевых LLM. Отдельной задачей стало исследование метрик уникальности сгенерированных промптов. Понимание насколько каждый следующий сгенерированный промпт уникален позволяет поддерживать высокое разнообразие тестового набора данных.
Второй проект — «Автоматизация формирования и проверки наборов данных для обеспечения соответствия ответов языковых моделей политике компании» — связан с управлением поведением LLM в прикладных сервисах. Открытые модели могут воспроизводить установки и ограничения, заданные их разработчиками, и не всегда учитывать требования конкретной компании и российского законодательства. Поэтому команде предстояло создать механизм, который помогает формировать обучающие и тестовые данные с учётом политики контента, запрещённых тем и недопустимых форм поведения модели.
Прототип разрабатывается для трёх сценариев: генеративного поиска товаров, автоматического формирования ответов на отзывы покупателей и чат-бота поддержки клиентов. Студенты собрали стартовый датасет промптов, сравнили открытые языковые модели для синтеза новых запросов и подготовили промпты для генерации данных и оценки ответов.
Два проекта решают взаимосвязанные задачи. Первый позволяет создавать усложнённые атакующие запросы и проверять устойчивость LLM к попыткам обхода ограничений. Второй формирует данные и инструменты оценки, необходимые для контроля соответствия ответов корпоративной политике. Вместе эти решения закладывают основу воспроизводимого контура тестирования языковых моделей перед их использованием в продуктах компании.
Антон Сергеев
Директор Центра программных разработок и цифровых сервисов МИЭМ,
руководитель мастерской от НИУ ВШЭ
«Мы ведем исследования и разработки области безопасного искусственного интеллекта уже несколько лет. Результаты наших научных и технологических изысканий – не только новые методы, алгоритмы, но и конкретные продуктовые решения. В МИЭМ ВШЭ создана, например, система для сканирования моделей ИИ на киберустойчивость и крупнейшая база дипфейков для моделирования атак на системы биометрической идентификации. Партнерство с Ozon Tech для нас крайне ценно, потому что даёт возможность проверить решения и концепции обеспечения безопасности ИИ на реальных наборах данных и бизнес-сценариях. А для студентов Вышки это важный этап старта карьеры как специалистов по безопасности искусственного интеллекта. Это большая удача -- начать развиваться как профессионал в такой высокотехнологичной компании как Ozon Tech, уделяющей большое внимание развитию кадров», — подчеркнул Антон Сергеев.
После предзащиты команды продолжат тестирование и доработку прототипов с учётом полученной обратной связи. Разработанные инструменты будут применяться для системной проверки безопасности и управляемости языковых моделей в практических сценариях Ozon Tech.