Разбираем, как AI-детекторы ошибочно маркируют качественный контент как машинный. Узнайте, почему чёткий стиль и логика — не признак AI, и что с этим делать.
Вы когда-нибудь получали уведомление, что ваш текст похож на AI-сгенерированный, хотя писали его сами? Я получил такое дважды за один день от системы модерации DEV.to по имени Sloan. Обе статьи были самыми технически насыщенными за год: короткие абзацы, точные данные, риторические вопросы. Те самые черты, которые делают текст убедительным, одновременно делают его «AI-образным» в глазах детекторов. Парадокс: пиши хорошо — выгляди как машина, пиши хуже — выгляди как человек.
Pangram — серьёзный классификатор с инженерной базой: hard negative mining против ложных срабатываний, зеркальные данные обучения, чтобы не путать формальный стиль с AI. Но он отвечает на узкий вопрос: «похож ли текст на AI-выход?», а не «вложил ли человек мысль?». Основатель Substack Крис Бест признаёт: Pangram не определяет, была ли вложена забота, только совпадает ли паттерн предложений с машинным.
Это и есть главная ловушка. Детекторы без зеркальных данных часто маркируют тексты носителей второго языка — аккуратный формальный стиль похож и на AI, и на перевод в голове. Некоторые университеты уже запретили AI-детекторы. Pangram утверждает, что решил проблему, но большинство цифр — от самого Pangram или заказанных им исследований.
Независимый журнал The Atlantic показал: детектор с точностью 99,98% может быть опаснее явно ненадёжного, потому что люди перестают перепроверять. Ошибки — реальные люди, реальные репутации.
В комментариях к той истории появился Марко — 40 лет в IT, пишет на втором языке, использует AI, чтобы итальянский не звучал жёстче задуманного. Он получил то же сообщение от Sloan, тот же вердикт классификатора. Никакого отношения к цели политики.
Марко — это я, это любой, кто использует AI как инструмент, а не генератор мнений. Я пишу из Порт-Харкорта на английском, использую AI, чтобы от черновика прийти к чистовику, не потеряв аргументацию. Sloan показал мне цену ложного срабатывания. Марко — версия этого риска, которую нельзя игнорировать.
Давайте посмотрим, как легко обмануть простой детектор и почему он не видит разницы между хорошим человеческим текстом и AI.
import re
from collections import Counter
# Простой детектор: считает повторы слов и длину предложений
def simple_detector(text):
sentences = re.split(r'[.!?]', text)
avg_len = sum(len(s.split()) for s in sentences if s) / max(len(sentences), 1)
words = re.findall(r'\w+', text.lower())
repeats = sum(count - 1 for count in Counter(words).values() if count > 1)
# Если предложения средней длины (15-25 слов) и мало повторов — «человек»
if 15 <= avg_len <= 25 and repeats < len(words) * 0.1:
return "human"
else:
return "AI"
# Пример хорошего человеческого текста (короткие предложения, точные данные)
human_text = "Алгоритм быстрой сортировки имеет сложность O(n log n). В худшем случае O(n²). Выбор опорного элемента критичен. Медиана трёх улучшает производительность."
print(simple_detector(human_text)) # Выведет "AI", потому что предложения короткие
# Пример плохого человеческого текста (длинные, размытые предложения)
bad_text = "Быстрая сортировка является одним из самых популярных алгоритмов сортировки, который был разработан Тони Хоаром, и он работает по принципу разделяй и властвуй, и в среднем он имеет сложность O(n log n), но в худшем случае она может быть O(n²), и это может произойти, если массив уже отсортирован, а опорный элемент выбран неудачно."
print(simple_detector(bad_text)) # Выведет "human"
Детектор ловится на длину предложений и повторы, а не на смысл. Хороший текст (коротко, ясно) помечается как AI, плохой (водянисто, длинно) — как человек. Реальность, в которой мы живём.
Не полагайтесь на AI-детекторы как на истину. Если вы используете AI в работе — признавайте это, но не ждите, что детекторы это оценят. Лучший способ защитить себя — писать так, чтобы за текстом стояла ваша мысль, и быть готовым ответить на вопрос: «Вы знали, о чём писали? Вы за это отвечаете?» Если да — детектор не ваша проблема.
Попробуйте прямо сейчас: возьмите свой последний текст и прогоните его через любой открытый детектор. Сравните результат с тем, что вы вложили. Удивитесь.
Хочешь закрепить знания на практике?
Решай задачи на Algolit — интерактивная платформа для обучения
Начать бесплатно →