Представьте: ученик сдаёт контрольную в полночь, а через минуту уже читает разбор своих ошибок. Не от учителя — от программы, которой учитель доверил первый просмотр. Именно так всё чаще выглядит проверка домашних заданий в школах и вузах разных стран.
Звучит удобно. Но у этой удобной картинки есть вторая сторона: в одном реальном исследовании ИИ поставил работе 50 баллов там, где преподаватель поставил бы 8. И это не страшилка из соцсетей, а результат научной работы. Разберёмся спокойно: почему ИИ добрался до проверки, что он делает хорошо, а где пока честно ошибается.
Что произошло
Сразу несколько независимых событий сошлись вместе. В марте 2026 года OECD выпустила большой доклад о работе учителей, основанный на данных, собранных ещё в 2024-м. Выяснилось важное: примерно каждый третий учитель в исследовании TALIS уже использует ИИ в своей работе. А каждый четвёртый из этих учителей применяет его именно для оценки и проверки работ учеников.
Причина проста и человечна. Около 40% учителей в странах OECD называют чрезмерный объём проверки источником стресса. Это не лень — это реальная нагрузка, которая забирает вечера и выходные.
Почти одновременно вышло исследование в журнале Scientific Reports (18 апреля 2026 года). Учёные дали шести популярным языковым моделям реальные анонимизированные работы 110 студентов курса по анализу данных. Модели читали их и выдавали письменный отзыв плюс оценку из 100.
А 14 января 2026 года британский регулятор Ofqual официально обозначил рамки: ИИ может помогать с проверкой, но использовать его как единственный механизм выставления итоговой оценки в регулируемых квалификациях — нельзя.
Почему это вообще интересно
Тут решается не технический, а очень бытовой вопрос: как вернуть учителю время, не потеряв при этом качество. Проверка сотни одинаковых работ — работа, которую человек делает по инерции к третьему часу ночи. Именно здесь у ИИ есть реальный шанс помочь.
Но есть и второй слой. Родителям и ученикам важно понимать: если в тетради появился разбор от программы, стал ли он честнее и полезнее — или просто быстрее? Ответ неочевидный, и приведённые ниже цифры помогают его увидеть без иллюзий.
Как это работает простыми словами
Большая языковая модель получает текст работы и «читает» её по кусочкам — они называются токенами. Это может быть слово или часть слова. Входные токены — сама работа, выходные — то, что модель пишет в ответ: отзыв и оценку.
Важная деталь из исследования: средняя проверяемая работа содержала около 50 139 входных токенов и лишь около 444 выходных. То есть модель должна прочитать очень много, а сказать по итогу — довольно мало. Именно на этом перепаде чаще всего и теряются мелкие, но значимые детали.
Дальше модель сравнивает написанное с критериями, которые ей задал преподаватель, и формирует текст: что получилось, что нет и почему. Всё это выглядит как обычный отзыв учителя — отсюда и соблазн доверить процесс целиком.
Что это реально умеет
- Проверять массово и быстро. В некоторых странах доля учителей, использующих ИИ для проверки работ, особенно высокая: в Азербайджане, Казахстане, Северной Македонии, ЮАР, Турции и Вьетнаме — не менее половины из тех, кто вообще применяет ИИ. В Узбекистане — около 85%.
- Давать структурированный отзыв. По оценке преподавателей (они разобрали 243 случая), в 79,8% случаев отзывы ИИ были информативными. Они читаемы, логичны и по форме похожи на то, что написал бы человек.
- Замечать общие проблемы. Лучшая из протестированных моделей, DeepSeek-R1, лучше других справлялась с задачей — она находила заметные недочёты и формулировала рекомендации.
Иными словами, как «первый читатель», который снимет с преподавателя рутину первого прохода, ИИ уже работает.
Что пока НЕ умеет или чего пока нет
Здесь начинается честная часть. Даже лучший результат в исследовании — у DeepSeek-R1 — давал среднюю абсолютную ошибку около 19 баллов из 100. То есть разброс оценок между человеком и программой измеряется не единицами, а десятками баллов. Остальные модели, включая GPT-4o и Llama, завышали оценки ещё сильнее и систематически.
Ошибки — не случайные. Разбор 243 случаев показал: в 60,9% отзывов ИИ пропустил небольшие, но важные ошибки, а в 77,8% — тонкие методологические проблемы. Ещё в 64,2% случаев расходилось само педагогическое суждение: преподаватель оценивал не только по формальным критериям, но и с учётом контекста, а модель — нет.
Самый наглядный пример — та самая работа с оценкой. DeepSeek-R1 поставил 50 баллов вместо преподавательских 8. Модель заметила проблему с периодом данных, но недооценила ошибки очистки и их влияние на весь анализ. Это ровно то, что человек видит «на глаз», а программа — пока не всегда.
Именно поэтому Ofqual и напоминает: валидность, прозрачность, справедливость и ответственность человека обязательны. ИИ не может быть единственным, кто выставляет итоговую оценку в регулируемых экзаменах.
Сколько стоит и когда появится
Цифры из исследования простые. Указанная там цена GPT-4o — около $2,50 за миллион входных токенов и $10 за миллион выходных. На одну работу это выходит очень немного, а на поток из сотен работ — уже заметная, но не запретительная сумма.
Открытые модели можно запускать локально и вообще не платить за токены. Правда, для этого нужны собственные вычислительные ресурсы и человек, который умеет всё это настроить и обслуживать. Так что «бесплатно» — это скорее про другой вид затрат: время и техника вместо денег.
Может ли это появиться в России
Прямых данных по России в этих исследованиях нет, и выдумывать их не стоит. Но есть два факта, из которых можно сделать аккуратный вывод.
Во-первых, ИИ-проверка — это не отдельный прибор, а программная функция. Она работает там, где есть доступ к языковой модели. Во-вторых, открытые модели можно запускать локально, без обращения к внешним сервисам, — именно этот путь чаще всего обсуждают в странах и организациях, где хотят контролировать данные учеников внутри своего контура.
Так что техническая возможность есть, а вот вопрос правил и культуры использования — пока открытый. Здесь важен не лозунг, а конкретика: кто отвечает за итоговую оценку и знает ли ученик, что работу сначала прочитала программа.
Что это изменит через несколько лет
Скорее всего, победят не крайности, а середина. ИИ станет тем, кем сегодня является черновая проверка: он прочитает работу первым, отметит очевидное и подготовит черновик отзыва. Финальную оценку и тонкое суждение оставит человек — потому что именно там модели пока ошибаются сильнее всего.
Для ученика это может означать более быструю обратную связь: не через неделю, а почти сразу. Для учителя — шанс вернуть себе вечера, которые сегодня уходят на проверку. А вот цена этого удобства — привычка перепроверять и не отдавать финальное слово машине.
И главный вопрос не «внедрять или запретить», а «как встроить так, чтобы ученик от этого выиграл». Кстати, вы бы согласились, чтобы вашу работу сначала проверял ИИ, а потом уже человек? Или предпочли бы, чтобы за неё сразу брался преподаватель?
Подпишитесь, чтобы понимать мир без шума: что произошло, как это работает и что изменится.
#технологии #искусственныйинтеллект #вмире #события
