«Хочешь честно? Это не про качество, а про лень». Не секрет, что доля написанного большими языковыми моделями контента продолжает расти; более того, ИИ-контент чаще попадает в наборы данных для обучения того же ИИ. Не существует способа гарантированно выявить сгенерированный текст, зато вполне устоялись языковые клише, активное использование которых может указывать на искусственное происхождение текста. Кстати, абзац начинается именно с такой фразы.
ИИ склонен употреблять конструкции вида «это не X, а Y» для неуместных противопоставлений, часто обращаться к читателю с риторическими вопросами: «И знаете что?», «Хочешь честно?». Другой известный маркер — перечисления из троек, когда предмету приписываются именно три каких-нибудь свойства. Меньше бросаются в глаза, но тем не менее из раза в раз присутствуют неуместные англицизмы, жаргонизмы или служебные фразы (так бывает редко, но иногда в тексте можно заметить что-то вроде «Надеюсь, это помогло»).
Самое главное — это не делает тексты низкокачественными по умолчанию, особенно если ИИ не действовал в качестве самостоятельного автора без четко заданных инструкций. Современные исследования показывают, что в некоторых случаях ИИ-тексты получаются даже качественнее человеческих. Нюанс заключается в том, что генеративные модели создают статистически похожие тексты. Это может приводить к снижению когнитивного разнообразия и сглаживанию языкового ландшафта.
ИИ производит похожие идеи и решения для миллионов людей, поэтому люди все больше становятся похожими на ИИ, не замечая, как характерные клише попадают даже не в письменную, а в устную речь. Вероятно, гомогенизация пространства мыслей продолжится, и нам лишь остается узнать в будущем, к чему приведет этот процесс. А вы замечали за собой использование «нейросетевых словечек»? Часто ли сталкиваетесь с ними в текстах на просторах Интернета?