Мир меняется
ГлавнаяТехнологии и ИИ

Почему учителя всё чаще доверяют проверку работ ИИ — и где он ставит 50 баллов вместо 8

Технологии и ИИ · 18.09.2026
Почему учителя всё чаще доверяют проверку работ ИИ — и где он ставит 50 баллов вместо 8

Представьте: ученик сдаёт контрольную в полночь, а через минуту уже читает разбор своих ошибок. Не от учителя — от программы, которой учитель доверил первый просмотр. Именно так всё чаще выглядит проверка домашних заданий в школах и вузах разных стран.

Звучит удобно. Но у этой удобной картинки есть вторая сторона: в одном реальном исследовании ИИ поставил работе 50 баллов там, где преподаватель поставил бы 8. И это не страшилка из соцсетей, а результат научной работы. Разберёмся спокойно: почему ИИ добрался до проверки, что он делает хорошо, а где пока честно ошибается.

Что произошло

Сразу несколько независимых событий сошлись вместе. В марте 2026 года OECD выпустила большой доклад о работе учителей, основанный на данных, собранных ещё в 2024-м. Выяснилось важное: примерно каждый третий учитель в исследовании TALIS уже использует ИИ в своей работе. А каждый четвёртый из этих учителей применяет его именно для оценки и проверки работ учеников.

Причина проста и человечна. Около 40% учителей в странах OECD называют чрезмерный объём проверки источником стресса. Это не лень — это реальная нагрузка, которая забирает вечера и выходные.

Почти одновременно вышло исследование в журнале Scientific Reports (18 апреля 2026 года). Учёные дали шести популярным языковым моделям реальные анонимизированные работы 110 студентов курса по анализу данных. Модели читали их и выдавали письменный отзыв плюс оценку из 100.

А 14 января 2026 года британский регулятор Ofqual официально обозначил рамки: ИИ может помогать с проверкой, но использовать его как единственный механизм выставления итоговой оценки в регулируемых квалификациях — нельзя.

Почему это вообще интересно

Тут решается не технический, а очень бытовой вопрос: как вернуть учителю время, не потеряв при этом качество. Проверка сотни одинаковых работ — работа, которую человек делает по инерции к третьему часу ночи. Именно здесь у ИИ есть реальный шанс помочь.

Но есть и второй слой. Родителям и ученикам важно понимать: если в тетради появился разбор от программы, стал ли он честнее и полезнее — или просто быстрее? Ответ неочевидный, и приведённые ниже цифры помогают его увидеть без иллюзий.

Как это работает простыми словами

Большая языковая модель получает текст работы и «читает» её по кусочкам — они называются токенами. Это может быть слово или часть слова. Входные токены — сама работа, выходные — то, что модель пишет в ответ: отзыв и оценку.

Важная деталь из исследования: средняя проверяемая работа содержала около 50 139 входных токенов и лишь около 444 выходных. То есть модель должна прочитать очень много, а сказать по итогу — довольно мало. Именно на этом перепаде чаще всего и теряются мелкие, но значимые детали.

Дальше модель сравнивает написанное с критериями, которые ей задал преподаватель, и формирует текст: что получилось, что нет и почему. Всё это выглядит как обычный отзыв учителя — отсюда и соблазн доверить процесс целиком.

Что это реально умеет

Иными словами, как «первый читатель», который снимет с преподавателя рутину первого прохода, ИИ уже работает.

Что пока НЕ умеет или чего пока нет

Здесь начинается честная часть. Даже лучший результат в исследовании — у DeepSeek-R1 — давал среднюю абсолютную ошибку около 19 баллов из 100. То есть разброс оценок между человеком и программой измеряется не единицами, а десятками баллов. Остальные модели, включая GPT-4o и Llama, завышали оценки ещё сильнее и систематически.

Ошибки — не случайные. Разбор 243 случаев показал: в 60,9% отзывов ИИ пропустил небольшие, но важные ошибки, а в 77,8% — тонкие методологические проблемы. Ещё в 64,2% случаев расходилось само педагогическое суждение: преподаватель оценивал не только по формальным критериям, но и с учётом контекста, а модель — нет.

Самый наглядный пример — та самая работа с оценкой. DeepSeek-R1 поставил 50 баллов вместо преподавательских 8. Модель заметила проблему с периодом данных, но недооценила ошибки очистки и их влияние на весь анализ. Это ровно то, что человек видит «на глаз», а программа — пока не всегда.

Именно поэтому Ofqual и напоминает: валидность, прозрачность, справедливость и ответственность человека обязательны. ИИ не может быть единственным, кто выставляет итоговую оценку в регулируемых экзаменах.

Сколько стоит и когда появится

Цифры из исследования простые. Указанная там цена GPT-4o — около $2,50 за миллион входных токенов и $10 за миллион выходных. На одну работу это выходит очень немного, а на поток из сотен работ — уже заметная, но не запретительная сумма.

Открытые модели можно запускать локально и вообще не платить за токены. Правда, для этого нужны собственные вычислительные ресурсы и человек, который умеет всё это настроить и обслуживать. Так что «бесплатно» — это скорее про другой вид затрат: время и техника вместо денег.

Может ли это появиться в России

Прямых данных по России в этих исследованиях нет, и выдумывать их не стоит. Но есть два факта, из которых можно сделать аккуратный вывод.

Во-первых, ИИ-проверка — это не отдельный прибор, а программная функция. Она работает там, где есть доступ к языковой модели. Во-вторых, открытые модели можно запускать локально, без обращения к внешним сервисам, — именно этот путь чаще всего обсуждают в странах и организациях, где хотят контролировать данные учеников внутри своего контура.

Так что техническая возможность есть, а вот вопрос правил и культуры использования — пока открытый. Здесь важен не лозунг, а конкретика: кто отвечает за итоговую оценку и знает ли ученик, что работу сначала прочитала программа.

Что это изменит через несколько лет

Скорее всего, победят не крайности, а середина. ИИ станет тем, кем сегодня является черновая проверка: он прочитает работу первым, отметит очевидное и подготовит черновик отзыва. Финальную оценку и тонкое суждение оставит человек — потому что именно там модели пока ошибаются сильнее всего.

Для ученика это может означать более быструю обратную связь: не через неделю, а почти сразу. Для учителя — шанс вернуть себе вечера, которые сегодня уходят на проверку. А вот цена этого удобства — привычка перепроверять и не отдавать финальное слово машине.

И главный вопрос не «внедрять или запретить», а «как встроить так, чтобы ученик от этого выиграл». Кстати, вы бы согласились, чтобы вашу работу сначала проверял ИИ, а потом уже человек? Или предпочли бы, чтобы за неё сразу брался преподаватель?

Подпишитесь, чтобы понимать мир без шума: что произошло, как это работает и что изменится.

#технологии #искусственныйинтеллект #вмире #события