Главная идея мультиагентной системы проверки студенческих артефактов (отчетов, презентаций, аудио- и видеоматериалов и др.) в том, что ИИ не оценивает работу всю сразу, а проверяет ее по частям, как это делает внимательный преподаватель с чек-листом.
Шаг 0. Жесткая формализация задания (фундамент)Подобная проверка студенческих артефактов закладывается еще на этапе формализации заданий.
Прежде чем студент начнет работу, ему предоставляет детализированное текстовое описание структуры отчета.
Чем точнее и однозначнее описание задания для студента, тем точнее ИИ сможет его потом проверить
Шаг 1. Декомпозиция на агентовСистема не отправляет готовый артефакт в модель с вопросом “Хорошо ли это?”. Вместо этого система парсит чек-лист и создает отдельный микро-запрос (агента) для каждого критерия (например, наличие введения, обоснования выбора базы данных и пр.). Каждый агент проверяет весь текст артефакта на наличие одного конкретного признака.
Шаг 2. Поиск доказательств и генерация отчета
Система анализирует студенческий артефакт и формирует структурированные данные, которые визуализируются в таблицу или дашборд. Для каждого критерия система выдает:
- Статус - выполнено / не выполнено / требует внимания
- Доказательство - прямая цитата из работы студента или указание на страницу/слайд
- Комментарий - обоснование, почему ИИ принял такое решение («Студент перечислил технологии, но не обосновал выбор, как требовалось в п. 2.3 задания»).
Шаг 3. Визуализация и обратная связьПреподаватель (эксперт) видит не общую оценку, а таблицу / дашборд с цветовыми маркерами:
- Зеленый цвет - критерии выполнены, есть доказательства, можно не проверять вручную
- Желтый цвет - формально текст есть, но смысловая связность под вопросом, или ответ нестандартный, требует выборочной ручной проверки экспертом
- Красный цвет - критические нарушения (загружен не тот файл, отсутствуют ключевые разделы, явный нейрослоп без смысла и пр.), требуют детального разбора или отправки на доработку
Технический стек и ограничения- В разных этапах использовались модели Claude (отлично справляется с логикой и кодом) и Gemini (модель исторически лучше обучалась на образовательных датасетах и лучше понимает суть андрагогики и образования); выбор модели зависел от типа проверяемого материала и результатов внутренних тестов
- Система отлично проверяет смысл и структуру (семантику), но ломается на микро-форматировании. Например, методичку по схемотехнике со 100+ требованиями (размер шрифта, точное расположение подписей к рисункам по ГОСТ и пр.), ИИ не смог осилить и начал галлюцинировать