Так, надо, видимо, чуть объяснить мой предыдущий пост, почему мы такой категоричный вывод сделали и обозвали клод тупым.
Расскажу на примере конкретной задачи. У нас основной инструмент продуктовой аналитики - это Mixpanel (кто не знает, это полный аналог Amplitude). В нем живет вся разметка продукта, там примерно 1500 описанных ивентов (триггеров когда разметка срабатывает), которые покрывают весь наш продукт. Там реально вообще все, все воронки, конверсии, ретеншны, клиентские пути и тд и тп. Мы каждого пользователя до трусов рассмотреть можем. И эта разметка в месяц генерирует больше 1 миллиарда событий. Можете себе представить объем данных, с которыми можно работать)
И вот мы сначала попробовали подрубить к кодексу мср микспанели, чтобы он разбирался во всей нашей аналитике и мог нам давать анализ по фичам и а/б тестам. Подрубили и задали ему простой вопрос: «вот такую фичу запустили, посмотри ее метрики, скажи результаты». И кодекс с этой задачей справился просто великолепно. Ты ему говоришь только название фичи в продукте - он сам сначала лезет в описание всех событий в лексиконе, потом по подходящим событиям смотрит все графики и дашборды, потом эти графики сам анализирует и дает вывод какой-то. И самое потрясающее, и, даже, немного пугающее - что выводы он делает охуеть какие правильные. Мы его сравнивали с а/б-тестами, которые мы сами вручную проанализировали - и там на 90% все совпадает.
Потом мы такую же задачу дали Клоду, и он вообще с ней не справился. Он, во-первых, ебал долго мозг чтобы просто мср микспанели подрубить, то у него доступов нет, то он не знает как подключаться, то мср недоступно, но это ладно, полбеды. Когда мы его начали также спрашивать, мол дай результаты такой-то фичи в продукте - то он оказался не в состоянии, как кодекс, самостоятельно пошерстить по микспанели и что-то разумное выдать. Он либо какую-то ахинею нести начинал, либо какие-то кривые выводы собирал, мог просто не найти нужные события в разметке и вместо них использовать другие, ну там пиздец. Он ни на одну фичу нормально не смог анализ дать, да хотя бы просто не напиздеть.
Да, наверняка если потратить достаточно времени на описание всего контекста и обучение работы модели именно под наш запрос, то и клод будет справляться хорошо. Но разница в использовании, так скажем, «в холодную», очень большая. Кодекс врубаешь и через полчаса ты гуру нашей продуктовой разметки. Клод врубаешь и даже через 2 дня ты нихуя не можешь по нашей аналитике из него достать. Так что, конкретно в этом кейсе, Codex оказался просто на голову выше Claude. А это я вам только на одном примере показал, мы и в другие места тоже внедряли, с таким же результатом. Поэтому и такой вывод 🤷