Айтівець влаштував іспит чотирьом LLM на реальних даних. Ось, що з цього вийшло
Product Marketing Manager в Railsware Артем Сагайдак влаштував іспит чотирьом LLM на реальних даних. Він поділився з dev.ua цим досвідом. Далі — пряма мова Артема.
Product Marketing Manager в Railsware Артем Сагайдак влаштував іспит чотирьом LLM на реальних даних. Він поділився з dev.ua цим досвідом. Далі — пряма мова Артема.
Product Marketing Manager в Railsware Артем Сагайдак влаштував іспит чотирьом LLM на реальних даних. Він поділився з dev.ua цим досвідом. Далі — пряма мова Артема.
Можна купити найдорожчу підписку на улюблений ШІ, грамотно прописати промпт і все одно отримати відповідь, яка не відповідає дійсності. Рівень кортизолу зростає, час до мітингу, де ти маєш презентувати дані, спливає, і ти починаєш згадувати всіх тих LinkedIn-інфлуенсерів із порадами та «100% робочими» промптами.
Як і всі маркетологи, я використовую ШІ для багатьох задач.Часто робота з ними більше виснажує, ніж дає справді класний результат. Тож я вирішив провести дослідження, а саме протестувати чотири найпопулярніші моделі GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro та Grok 4.3 і порівняти результати.
Я завантажив однакові датасети через Coupler.io: воронку, ICP-розбивки, аналіз відтоку, ефективність кампаній тощо. У режимі Agent (Medium) у Cursor я ставив десять запитань в однаковому порядку: знайти прогалини в даних, побудувати профілі клієнтів, проаналізувати воронку, оцінити ризик відтоку, порахувати втрачений дохід і запропонувати стратегічні рекомендації.
Аби середовище було ближчим до реального, я згодовував моделям дані, у яких подекуди бракувало чіткості: вони суперечили одне одному або не дозволяли зробити впевнений висновок. Саме це допомогло краще розгледіти поведінку кожної моделі та зрозуміти, коли яку варто використовувати.
Тож якщо цікаво побачити результати, ось що в мене вийшло.

Я, звісно, міг би поділитися результатами всіх десяти запитань. Але щоб не завалювати вас, зупинюся на трьох найцікавіших (насправді, обрати було складно). Саме на них найкраще видно розбіжності в поведінці моделей у популярних кейсах.
Запитання: проаналізуй Q4 2025, а саме, які кампанії мають найвищу вартість залучення (CPA) відносно конверсії з пробного періоду в передплату? На яких із них варто скоротити витрати? (eng: Let’s analyze Q4 2025. Which campaigns have the highest CPA relative to their trial-to-paid conversion? Where should we cut spend?)
Тут перевірялося, чи здатна модель посеред задачі виявити прогалину в даних і все одно видати щось корисне: попрацювати з наявним, пояснити, чого бракує, і запропонувати конкретний наступний крок.


Запитання: які комбінації джерел даних найчастіше під'єднують наші e-commerce клієнти, і що саме корелює з найвищою конверсією в платних (eng: What are the most common data source combinations our e-commerce customers connect and which combos correlate with the highest paid conversion rate?)
Перевіряв, чи здатні моделі виявляти кореляцію між комбінаціями конекторів і платною конверсією, і чи можуть вони відрізняти обсяг (що найпоширеніше) від ефективності (що дає конверсію).


Запитання: якби ти був нашим продакт-маркетинг-менеджером, що саме ти б змінив на основі цих даних? (eng: If you were our Product Marketing Manager, what one thing would you change based on this data?)
Тут було цікаво, чи здатна модель синтезувати весь датасет в одну обґрунтовану стратегічну рекомендацію й подати її саме як рішення PMM, а не як спостереження аналітика.


Після десяти тестів відповідь виявилася не такою очевидною, як хотілося б. Усі моделі вміють аналізувати дані й можуть стати хорошими помічниками у роботі. Утім, роблять вони це дуже по-різному.
Одні швидше знаходять закономірності, інші краще пояснюють свої висновки, треті впевненіше переходять від аналізу до конкретних рекомендацій. Тому вибір моделі залежить не стільки від того, яка з них найкраща, скільки від того, який результат ви хочете отримати.
Також додаю короткий підсумок поведінки LLM-моделей.

Якщо коротко, ставтеся до моделі не як до чарівної кулі, а як до дуже швидкого колеги-джуніора. Вона може за хвилину знайти закономірність, яку ви шукали б годину. Але так само може впевнено піти не туди, якщо отримала нечітке завдання або сумнівні дані.
Ось кілька порад, які справді покращують результат:
Десять тестів показали дивну річ: моделі майже не сперечаються між собою про відповіді. Вони сперечаються хіба про подачу. Там, де дані чисті, чотири різні архітектури приходять до одного висновку. І це добра новина для всіх, хто боявся довіряти цифрам з чату.
Погана новина ховається в іншому. Жодна з чотирьох не спитала, чи коректно взагалі поставлене питання. Не запропонувала подивитися в CRM, де вже лежить готовий список ризикових клієнтів. Не порахувала, скільки коштуватиме розворот стратегії, який сама ж радить. Моделі грають блискуче, але тільки в межах дошки, яку їм намалювали.
Тому робочий розподіл на найближчий час виглядає так: модель шукає і рахує, людина ставить рамку і сумнівається. Перше вже коштує копійки й займає хвилини. Друге, як з’ясувалося, поки не продається ні за який токен. Можливо, нові моделі змінять цей баланс, але це вже тема для іншої статті.

