7 из 10. Оцениваем* журнал Самозванца
Можно ли взять несмышленного менеджера, дать ему гэпэтэшку и попросить предварительную оценить профильный материал? Типичная IT-задачка. Экспериментируем на примере журнала "Самозванец". Не нашел ни одной оценки от профильных экспертов. Где же вы, когда так нужны? Контент сам падает вам в руки 🤷 Подход суровый: только GPT-5 Thinking, строгий шаблон, постраничная оценка, только с опорой на надёжные источники, с постоянным чекапом контекста и оценки. Из интересного, чат сдулся на 40-й странице — начал жестко галлюцинировать. Горький опыт научил готовить логи, поэтому переехал без проблем 😊 На что я обратил внимание, пока постранично скармливал материал:
- почти нет научной базы или отсылок к ней
- нет описаний исходного исследования или ссылок к нему. ЦА, опросник, где опрашивали, в каком формате
- эксперты указаны ссылками в конце, заполненные профили у двух человек Я бы сказал, что это очень подробный тизер будущего исследования 😅 Как думаете, достойный результат исследования с привлечением 11 экспертов от СМИ с 20к подписчиков в сотрудничестве с hh.ru? Вместо вывода - кейс: Вы менеджер без профильной базы, но вам нужно предварительно оценить материал или аналитику для команды (например, питч от стартапа). За вами 100% перепроверят. Взяв критерии этой перепроверки вы сможете давать близкую предварительную оценку, экономя ресурс и время команды. Плюс глубже погрузитесь в материал. Возвращаясь к теме поста - эксперимент считаю удачным. Промпт могу прислать 💪 Далее задротские подробности. Нейросетевая аналитика 🤖 Используемый фреймворк — 12 критериев с весами, разделённых на три блока. Он объединяет подходы из академических рубрик, журналистских стандартов и гайдлайнов по документации (Google, Microsoft). Вес приоритизирует ценное: 0.16 — практическая ценность и доказательность; 0.08–0.12 — полнота и логичность; 0.03–0.06 — визуалы и этика. Развернутые веса в конце 👇 Итоговый взвешенный балл: 7.5 из 10 ТОП-5 сильных сторон журнала Ясность и доступность языка — 8.96. Логичность структуры — 8.60. Визуальное оформление — 8.56. Этика и инклюзивность — 8.50. Эмоциональная поддержка — 8.02. ТОП-5 зон роста Качество высказываний специалистов — 5.54. Новизна — 5.69. Доказательность и источники — 6.70. Баланс субъективного и объективного — 6.81. Полнота раскрытия темы — 7.62. Рекомендации по улучшению:
- Добавлять ссылки на исследования и короткие цитаты.
- Уточнять термины и границы применения техник.
- Для упражнений указывать метрики, условия и риски.
- Подписывать визуалы и добавлять альтернативный текст.
- Сохранять единый стиль и плавные переходы. Критерии оценки (веса) Полнота раскрытия темы (0.12) — насколько материал охватывает все ключевые аспекты и вопросы. Качество высказываний специалистов (0.08) — уровень компетентности и репрезентативность привлечённых экспертов. Практическая ценность (0.16) — наличие конкретных техник, инструкций и рекомендаций для применения. Новизна и оригинальность (0.06) — степень свежести идей и уникальности подхода. Логичность структуры (0.08) — последовательность изложения и связность материала. Ясность и доступность языка (0.10) — простота понимания, отсутствие лишней сложности. Визуальное оформление (0.06) — качество иллюстраций, схем и таблиц, их понятность. Эмоциональная вовлечённость/поддержка (0.04) — способность мотивировать и поддерживать читателя. Баланс субъективного и объективного (0.06) — соотношение фактов, данных и личных мнений. Доказательность и источники (0.16) — наличие и качество ссылок на исследования и подтверждающих данных. Точность терминологии (0.05) — корректность и точность используемых понятий. Этика и инклюзивность (0.03) — уважение к аудитории и отсутствие дискриминационных формулировок. Там еще 2 листа ссылок на источники, но Сетка такое не любит. Всех обнял 💜
· 16.09.2025
Как-то проводил исследование рынка продуктов связанных с энергетикой (программные продукты которые позволяют котельным, подстанциям работать полностью автономно, без персонала постоянного)
Просил оставлять ссылки на источники, когда я искал информацию по сегментам и по продуктам представленным на рынке.
В итоге я при сдаче/презентации первого итога моего исследования очень жидко обосрался. Ведь ссылки не просто нужно было проверить а прям высчитывать из них определённую информацию. Как оказалось, её местами вообще не было, либо цитирование было взято из какого какого-то рандомного комментария либо вообще галлюцинации(такого контента вовсе нет).
Понятное дело что это была черновая версия, потом я уже переделал, использовал локальную версию LLM-ок  и у меня результат получился гораздо лучше, чем « пользовательская» версия чата GPT.
Если бы я не проверил источники либо бы забил, информация была бы абсолютно искаженной, тем самым подвёл бы очень сильно коллег и себя.
Короче , как-то так… локалке работают пока что нормально, видимо из-за оплаты в зависимости от потраченных токенов, без привязки к подписке  Тот же gemini, claude sonnet, opus, qwen работают стабильнее, через API
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
коммент удалён
· 16.09.2025
Гптешка нормально собирает, если прописать жесткие правила и валидирование. Ну и я всегда проверяю, что она там понаходила. Если просить указывать цитату, на основе которой она сделала аналитический вывод, можно отслеживать галлюцинации 💪
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён
· 16.09.2025
Да, так и делал. Просил цитировать прямо из источника. А вот запрашивать указать цитату на основе которой сделаны аналитически вывод - это полезно, попробую так поделать 👌😁
Согласен с тем что надо жёстко промптить, чат гпт будто бы больше остальных моделек этого требует
0
ответить
коммент скрыт — часть юзеров считает его токсичным или некорректным
ответ удалён