Встреча от 1 октября 2026 года в рамках серии встреч от департамента образовательной деятельности “Открытые практики оценивания с ИИ”. На ней была представлена собственная разработка А. Авдюшиной — мультиагентная система проверки студенческих артефактов и три кейса, где она применялась

  1. Формализация требований как главный инструмент. Чем точнее прописаны критерии задания (чек-листы, шаблоны отчетов и пр.), тем эффективнее работает ИИ-помощник и тем проще отличить осознанную работу от нейрослопа. Универсальные модели плохо понимают контекст дисциплины; специфические промпты (системные инструкции) работают лучше.
  2. ИИ как фильтр. ИИ не заменяет экспертную оценку смысла или креатива, но берет на себя рутину: проверку соответствия формату, наличия обязательных элементов, первичную сортировку работ по степени риска (зеленые / желтые / красные зоны). Это экономит время экспертов для глубокого анализа сложных случаев.
  3. Проблема масштабируемости обратной связи. В условиях большого потока студентов (МегаШколы, массовые курсы) главная боль - не проверка факта сдачи, а предоставление качественной обратной связи за ограниченное время. Автоматизация этого этапа критически важна для мотивации студентов.
  4. Этический тупик “инструмент против инструмента”. Попытка запретить ИИ через детекторы ИИ часто контрпродуктивна. Более устойчивая стратегия - интеграция ИИ в учебный процесс как партнера (например, автопроверка черновиков студентом до сдачи преподавателю), смещая фокус с “поймал ли я списывание” на “понял ли студент задачу”.
  • Создавать жесткие текстовые шаблоны ответов, которые легко парсить.
  • Использовать LLM в режиме чата с фиксированным системным промптом для проверки конкретных пунктов чек-листа, а не всей работы целиком.
  • Внедрять этап самопроверки студентами перед сдачей.
Контакты А. Авдюшиной для связи:
avdiushina@itmo.ru
tg: @sunnysubmarines
Главная идея мультиагентной системы проверки студенческих артефактов (отчетов, презентаций, аудио- и видеоматериалов и др.) в том, что ИИ не оценивает работу всю сразу, а проверяет ее по частям, как это делает внимательный преподаватель с чек-листом.
Шаг 0. Жесткая формализация задания (фундамент)
Подобная проверка студенческих артефактов закладывается еще на этапе формализации заданий.
Прежде чем студент начнет работу, ему предоставляет детализированное текстовое описание структуры отчета.
Чем точнее и однозначнее описание задания для студента, тем точнее ИИ сможет его потом проверить
Шаг 1. Декомпозиция на агентов
Система не отправляет готовый артефакт в модель с вопросом “Хорошо ли это?”. Вместо этого система парсит чек-лист и создает отдельный микро-запрос (агента) для каждого критерия (например, наличие введения, обоснования выбора базы данных и пр.). Каждый агент проверяет весь текст артефакта на наличие одного конкретного признака.
Шаг 2. Поиск доказательств и генерация отчета
Система анализирует студенческий артефакт и формирует структурированные данные, которые визуализируются в таблицу или дашборд. Для каждого критерия система выдает:
  1. Статус - выполнено / не выполнено / требует внимания
  2. Доказательство - прямая цитата из работы студента или указание на страницу/слайд
  3. Комментарий - обоснование, почему ИИ принял такое решение («Студент перечислил технологии, но не обосновал выбор, как требовалось в п. 2.3 задания»).
Шаг 3. Визуализация и обратная связь
Преподаватель (эксперт) видит не общую оценку, а таблицу / дашборд с цветовыми маркерами:
  • Зеленый цвет - критерии выполнены, есть доказательства, можно не проверять вручную
  • Желтый цвет - формально текст есть, но смысловая связность под вопросом, или ответ нестандартный, требует выборочной ручной проверки экспертом
  • Красный цвет - критические нарушения (загружен не тот файл, отсутствуют ключевые разделы, явный нейрослоп без смысла и пр.), требуют детального разбора или отправки на доработку
Технический стек и ограничения
  • В разных этапах использовались модели Claude (отлично справляется с логикой и кодом)  и Gemini (модель исторически лучше обучалась на образовательных датасетах и лучше понимает суть андрагогики и образования); выбор модели зависел от типа проверяемого материала и результатов внутренних тестов
  • Система отлично проверяет смысл и структуру (семантику), но ломается на микро-форматировании. Например, методичку по схемотехнике со 100+ требованиями (размер шрифта, точное расположение подписей к рисункам по ГОСТ и пр.), ИИ не смог осилить и начал галлюцинировать
Кейс 1. Прозрачное оценивание проектов в МегаШколе (ML System Design)
  • Контекст: Отбор на магистратуру/стажировки. Около 100 командных проектов (180–300 студентов). Оценивать вручную сотни разнородных отчетов, схем и видео-питчей за короткий срок физически невозможно.
  • Что делает ИИ: Мультиагентная система (Claude, Gemini) анализирует текстовые отчеты по чек-листу преподавателя, ссылки на репозитории и транскрипты видео. На выходе формирует ранжирование по зонам риска (зеленая/желтая/красная) и первичные комментарии.
  • Результаты: Время проверки существенно сократилось. Эксперты сфокусировались только на «красной» и «желтой» зонах.
  • Ошибки и инсайты: Попытка проверить все одним промптом провалилась — задачу пришлось разбивать на микро-шаги между агентами. Обнаружилось, что студенты пытаются обмануть ИИ красивым, но бессмысленным текстом, поэтому систему дообучили проверять связность фактов.

Кейс 2. Предзащита ВКР
  • Контекст: Утверждение тем и предзащиты ВКР (~300 студентов). Комиссия тратит слишком много времени на рутинные замечания по оформлению, целям и структуре вместо сути.
  • Что делает ИИ: Агентский фреймворк переводит слайды презентаций в текст и проверяет их по жестким формальным правилам программы (например, блокирует некорректные формулировки целей вроде «Разработать сайт» без измеримых метрик).
  • Результаты: В пилоте обработано около 100 работ. Время прослушивания групп сократилось на 40–60 минут. Студенты получали автоматический фидбек по форме за 3 дня до защиты и успевали все исправить.
  • Ошибки и инсайты: ИИ иногда верил «красивой лжи» в тексте. Проблема «нейрослопа» (сгенерированных ИИ введений) осталась решенной не до конца, так как глубокий смысловой анализ пока слишком дорог для базовых моделей.

Кейс 3. Оценка видеоматериалов для отбора на стажировку
  • Контекст: Финал отбора после МегаШколы (36 кандидатов). Нужно оценить 6–7 часов видео и скринкастов кода, чтобы понять ход мыслей студентов. У экспертов и HR замыливается глаз при поточном просмотре.
  • Что делает ИИ: Сервис транскрибации + LLM анализируют речь и код. На выходе выдают структурированное резюме: какие проблемы назвал студент, как аргументировал выбор технологий и где ошибся, подкрепляя выводы точными цитатами.
  • Результаты: Трудозатраты резко снизились. Все 36 участников получили обратную связь за 1 день, а эксперты по фактам отобрали топ-10 для живых собеседований.
  • Ошибки и инсайты: Общая суммаризация текста упускала детали. Пришлось перейти к точечной проверке транскрипта по конкретным вопросам. Главная сложность сейчас — связать аудиопоток с тем, что происходит на экране (ИИ пока не может надежно сопоставить речь с показом кода или архитектурных схем).
Как оценивать задания, если они сложные и их много
Как устроена мультиагентная система
Ситуации, где применялась мультиагентная система
Выводы
Рабочие принципы в отсутствие подобной мультиагентной системы
Материалы от А. Авдюшиной
Анна Авдюшина
Доцент факультета программной инженерии и компьютерной техники