Математика и кофе: заметки с тегом конверсия

График конверсии с доверительным интервалом

Иван Балдин — Tue, 25 May 2021 01:13:50 +0300

Некоторое время с удовольствием использую более свежую визуализацию конверсии, добавляя к своим диаграммам границы доверительного интервала.

Конверсия офисов продаж

Итак, например, мы оцениваем эффективность работы территориальных офисов продаж. Под эффективностью понимаем отношение числа совершенных продаж к числу заявок (конверсию заявок в продажи, или просто «конверсию»). То есть, если в офисе «Сокольники» за квартал было 19 продаж на 33 заявки, их эффективность будем считать равной 19/33 = 57,6%.

Очевидно, что одни офисы работают эффективнее других: конверсия по офисам меняется от 57,6% до 17,6%. Заметно также, что и число заявок в офисах различно: от 33 заявок в «Сокольниках» до 706 заявок в «Лианозово».

Обычно на этом этапе многие останавливаются, но есть несложный способ воспользоваться понятием «доверительного интервала» или «стандартного отклонения (SD)», чтобы показать то, что, на первый взгляд, не так заметно.

Оцениваем размер выборки и величину SD

Как нетрудно заметить, из-за неравного числа заявок по разным офисам («Сокольники» отличаются в этом смысле от «Лианозово» почти в 22 раза), уверенность в надежности рассчитанной конверсии будет не одинакова. Так, для «Лианозово» результат в 36,1% достигнут на выборке из 706 заявок и может считаться вполне надежным; в «Сокольниках» мы получили результат 57,6% на небольшой выборке в 33 заявки, из-за чего нет уверенности, что, получи со временем последние свои 706 заявок, они бы удержали результат на том же уровне.

Разумеется, необходимо прикинуть размер доверительного интервала для каждого офиса продаж, исходя из числа заявок, то есть, размера выборки.

Уже знакомая нам формула стандартного отклонения (SD), или σ:

где p — величина конверсии, n — число заявок.

Считаем в колонке E:

Полученная величина стандартного отклонения (SD) показывает погрешность при расчете конверсии, и, очевидно, оказалась выше там, где была меньше выборка. Чем меньше данных, тем менее надежен рассчитанный результат, и тем меньше мы уверены в нашей оценке эффективности соответствующего офиса продаж.

Считаем границы 90%-го доверительного интервала

Дополним нашу таблицу рассчитанными нижней и верхней границей 90%-го доверительного интервала. Другими словами, оценим разброс конверсий по каждому из офисов продаж, так, что с вероятностью 90% мы будем уверены, что истинная конверсия лежит в пределах этого диапазона.

Зная о том, что границы 90%-го доверительного интервала лежат в пределах ±1,645SD, вычитаем и прибавляем 1,645SD для нижней и верхней границ, соответственно. Для «Лианозово» получаем, что их истинная конверсия лежит в пределах от 33,1% до 39,1%. (По-прежнему, в 1 случае из 10 она выходит за границы нашего интервала, но зато в 9 случаях из 10 мы не ошиблись).

Дополняем график, рисуя «свечи»

В Excel 2013 воспользуемся «биржевой диаграммой», указав вместо самого высокого и самого низкого курсов верхнюю и нижнюю границу наших доверительных интервалов, а вместо курса закрытия — рассчитанную вначале конверсию:

Доработанная подобным образом диаграмма не меняет выводов, полученных в самом начале. Однако, для наблюдательного руководителя она ненавязчиво напоминает, что полученные значения конверсий офисов продаж не конечны, и особенно «не конечны» там, где оказались шире границы разброса конверсии.

«Сокольники», предварительно, обогнали «Беговой», однако, если хороший результат «Бегового» надежен за счет узкого интервала, то результат «Сокольников» очень приблизителен, поэтому уверенные выводы возможно делать лишь о части офисов продаж, для остальных — нужно больше данных, а до тех пор их позиции в рейтинге можно считать лишь предварительными, или, как было сказано выше, не конечными.

См. также:

http://italylov.ru/blog/all/ctatisticheskaya-dostovernost-koltrekinga/

Доверительный интервал биномиального распределения по методу Уилсона

Иван Балдин — Wed, 01 Apr 2020 16:54:50 +0300

В процессе изучения биномиального распределения, обратил внимание, что стандартный способ определения доверительного интервала через ±1,645SD не всегда точен. Грубо говоря, если «решка» выпала меньше, чем в 10 бросках, то, скорее всего, либо вы сделали мало бросков, либо у вас вероятность выпадения «решки» в «заколдованной монетке» сильно невелика; если np < 10, лучше воспользоваться более сложными формулами, дающими более точные оценки при маленьких p или n:

По мнению многих статистиков, наиболее оптимальную оценку доверительных интервалов для частот осуществляет метод Уилсона (Wilson), предложенный еще в 1927 году <...>. Данный метод не только позволяет оценить доверительные интервалы для очень малых и очень больших частот, но и применим для малого числа наблюдений.

Звучит заманчиво. Попробуем разобраться.

Метод Уилсона

Нижняя и верхняя граница доверительного интервала p = 1—α/2 вычисляются следующими формулами:

Формула расчета нижней и верхней границ, соответственно.

где p — наблюдаемая вероятность «выпадения решки», N — число измерений («бросков»), z — z-оценка (например, 1,960 для 95%-го доверительного интервала, или 1,645 для 90%-го).

Пример и калькулятор для расчета

Предположим, нам удалось прослушать 10 рандомных звонков колл-центра, и в 4 из них оператор забыл или поленился уточнить у клиента источник рекламы. Скорее всего, исходя из данной информации, операторы не уточняют источники рекламы в 40% звонков.

Однако, это очень смелое утверждение, ведь наша выборка (10 звонков) откровенно мала: для получения более точной оценки качества работы коллцентра, хорошо бы прослушать больше рандомных звонков (прослушать все звонки, очевидно, невозможно).

Но даже для выборки из 10 звонков, можно рассчитать SD биномиального распределения:

Имеем, SD = 15,49%. С вероятностью 90%, точная оценка качества работы коллцентра (доля звонков, где не выявлен источник рекламы) лежит в диапазоне 40%±1,645SD, или от 14,52% до 65,48%.

Применяя же формулу Уилсона (что уместно, так как np = 4 < 10), границы доверительного интервала уточняются: с вероятностью 90%, истинная доля звонков, где не выявляется источник рекламы, лежит в границах от 19,42% до 64,84%. SD, получается, равно 13,80%.

Калькулятор в Google Таблицах (меню «Файл» — «Создать копию»).

См. также:

«Доверительные интервалы для частот и долей», А.М. Гржибовский, 2008 (стр. 58-59)
Онлайн-калькулятор для 95%-го доверительного интервала
Калькулятор на WolframAlpha.com
Binomial confidence intervals and contingency tests (стр.4-5)
https://influentialpoints.com/Training/confidence_intervals_of_proportions.htm#wils
Wilson score interval на Википедии

Голосовой робот KupiVIP, угадываем размер выборки

Иван Балдин — Sat, 20 Jul 2019 13:18:48 +0300

В статье «Кейс: заменили на Black Friday колл-центр KupiVIP роботом, и только 5 человек из 5000 поняли, что общаются с нейросетью» на vc.ru меня, среди прочего, не могла не заинтересовать фраза, где автор рассказывает о росте конверсии с 6% до 8%:

Естественно, я задумался, на каком же объеме звонков был зафиксирован данный рост конверсии, и достаточен ли был этот объем, чтобы можно было достоверно утверждать, что голосовой робот эффективнее живых операторов колл-центра.

Точно вопрос можно было бы сформулировать, например, следующим образом: какой минимальный объем звонков требуется сделать, чтобы с уровнем достоверности, например, 95% зафиксировать рост конверсии с 6% до 8%?

Строим эксперимент в Excel

Попробуем выписать имеющиеся данные в Excel. Для дальнейших расчетов нам понадобится параметр «число звонков» — предположим пока, что и робот, и операторы сделали по 1000 звонков, прежде чем были получены конверсии 6% и 8%:

Вообще, налицо обычный А/Б сплит-тест, и далее нам нужно будет пройтись по его алгоритму для получения Z-оценки и расчета p-значения.

Рассчитаем стандартные ошибки (SD, или σ) для обеих конверсий и стандартную ошибку разницы этих конверсий. Формула для расчета стандартной ошибки конверсии:

где p — конверсия (6%, например), n — размер выборки (1000 звонков). Считаем в Excel:

Стандартная ошибка разницы конверсий — считаем по формуле:

где σ — это стандартная ошибка каждой из конверсий A и B (оператор и робот). В Excel посчитаем ее чуть ниже:

Насколько разница между конверсиями A и B больше, чем стандартная ошибка этой разницы? Это соотношение называется Z-оценкой. В Excel считается совсем просто:

Итак, Z-оценка = 1,7541. На графике нормального распределения это соответствует 96%-му персентилю, то есть, вероятность, что Z-оценка случайно окажется выше 1,7541 составляет порядка 4% (иными словами, 96% площади под колоколом нормального распределения не выходят за пределы +1,7541 стандартных отклонений):

Откуда мы взяли именно 96%? Точное значение вероятности, p-значение, вычисляем по формуле:

=НОРМ.РАСП(1,7541;0;1;ИСТИНА)

P-значение = 96,03%.

Итак, промежуточный вывод: если на выборке в 1000 звонков в каждом из двух случаев мы обнаружили конверсии (активации промокода) в 6% и 8% звонков, то мы на 96% уверены, что эта разница не случайна. (Остается 4% вероятности, что обнаруженная разница — случайность. Тогда, возможно, конверсия вообще одинакова и равна, например, 7%. Сделай мы больше звонков, разница вскоре сошла бы на нет).

Эксперимент минимального размера

Однако, вернемся к первоначальной задаче.

Мы не хотели убедиться, что 8% больше, чем 6%, да и цифра 1000 звонков для робота и операторов была выбрана наугад. Мы хотели рассчитать минимальное количество звонков, чтобы с уровнем уверенности 95% зафиксировать статистическую значимость разницы между 8% и 6%.

1000 звонков нам оказалось точно достаточно. Теперь нам остается уменьшать это число до той поры, пока p-значение не пересечет границу 95%. (По формуле нормального распределения, кстати, это будет соответствовать Z-оценке, равной 1,6449 — попробуйте проверить.)

В теории, наверное, можно было бы вывести большую формулу для расчета такого n, при котором p-значение будет равно 0,95. На практике, быстрее окажется вручную подобрать минимальное n. Или, еще лучше, воспользоваться в Excel инструментом Данные — Анализ «что, если» — Подбор параметра:

(Убедитесь только, что число звонков робота ровно то же самое, что и число звонков оператора, т. е. вы указали =C6 в ячейке C7).

Выводы

Итак, мы вычислили минимальные условия эксперимента для оценки эффективности голосового робота для KupiVIP.

Нужно не менее 878 звонков в каждой из двух групп, чтобы с уровнем достоверности 95% подтвердить наличие разницы между 6% активаций промокодов в контрольной группе (реальные сотрудники) и 8% в тестовой группе (голосовой робот).

(Единственное, ни 6%, ни 8% не дают целого числа активаций на выборке из 878 звонков, и, в реальности, конечно, цифры будут другие, причем число звонков в двух группах вообще может быть различным. Но, на самом деле, это не имеет большого значения, т. к., наверняка, в статье были приведены округленные значения конверсий).

См. также:

https://abtestguide.com/calc/?ua=1000&ub=1000&ca=60&cb=80

Когнитивная ошибка конверсии

Иван Балдин — Tue, 07 May 2019 12:39:07 +0300

Любопытная особенность работы с понятием конверсия заключается в том, что, строго говоря, конверсия практически никогда не бывает определена точно.

Вот эти вот «конверсия звонка в продажу 18,4%», «CTR 3,1%», «конверсия в сделки 30%» — это всегда немного упрощенный подход, будто конверсия надежно измерена и, если и изменится, то мы это объясним объективными факторами, не допуская мысли, что изначально никаких «18,4%» и не было, а были только 38 договоров, которые мы сделали на 206 звонках, и это вовсе не значит, что их не могло бы быть больше или меньше.

Примерно, как местоположение электрона вокруг ядра атома не задается точными координатами, а лишь описывается некоторой областью, в которой он, наиболее вероятно, находится, наша конверсия — это тоже не конкретное число, а, в действительности, интервал, в котором она находится.

Расчет конверсии и когнитивное искажение

Рассмотрим вымышленный отдел продаж, в котором с этого года начали продавать новый продукт. Допустим, ммм, лимузины. Продукт не пользуется большим спросом, поэтому, пока что, данных для анализа не так много, или, лучше сказать, совсем мало:

месяц	Заявки	Продажи
август	48	1
сентябрь	35	1
октябрь	24	0
ноябрь	61	2
декабрь	32	0
ИТОГО:	200	4

Как видно из данных наших продаж, по итогам нескольких месяцев, мы имеем 4 сделки на 200 лидов (заявок), т. е. наша конверсия равна 4 / 200 = 2,0%

(Дополнительно, исходя из цифр пяти месяцев работы, мы можем примерно спрогнозировать 480 лидов на следующий год и, соответствнно, 480 * 0,02 = 9,6 сделок.)

В целом, на таких скудных данных ошибиться невозможно, поэтому, безусловно, такой прогноз не будет ошибочным. Однако, он содержит важное когнитивное искажение: 2,0% это не точное значение, а наиболее пока вероятное значение конверсии заявок в продажи наших лимузинов.

В действительности, конверсия не может быть определена точно. Она лежит в доверительном интервале от 0,4% до 3,6%. И в будущем году нужно прогнозировать не 9,6 сделок, а от 5 до 15 проданных лимузинов. К сожалению, определить этот диапазон точнее будет довольно самонадеянным.

Колокол конверсии

Исходя из предположения, что наша истинная конверсия стабильна, и точно равна 2,0%, мы можем прикинуть возможные варианты числа сделок на 480 лидов, ожидаемых в будущем году. Поскольку мы можем отвечать только за стабильность своей работы, но не можем учесть фактор случайности (настроение клиентов, форс мажор, случайная продажа другу гендиректора), всегда существует вероятность, что число сделок будет немного отличаться от прогнозируемых 480 * 0,02 = 9,6 сделок подобно тому, как число решек на 480 бросков монеты может немного отличаться от 240, и быть 235, 248, или, возможно, даже 223.

Графически это выглядит как колокол нормального распределения, где, чем дальше мы уходим от математического ожидания в 9 сделок в центре колокола, тем ниже становится вероятность сделать сильно меньше или сильно больше сделок:

Глядя на полученный график, приходится признать, что увидеть меньше 2-х и больше 19-ти сделок практически невероятно.

Но, можно ли сузить наш доверительный интервал?

Доверительный интервал конверсии

Стандартная ошибка (SD) для биномиального распределения считается по формуле:

где n — это число испытаний, p — вероятность успеха.

Для наших 200 заявок текущего года имеем:

SD = 1,98 сделок. Иными словами, согласно законам нормального распределения (а биномиальное распределение — это частный случай нормального распределения), примерно в 68% случаев, работая с истинной конверсией 2,0%, мы бы попали в доверительный интервал от 2,02 до 5,98 сделок, то есть +/-1SD.

Для прогнозируемых 480 заявок будущего года получим:

SD = 3,07 сделок. По законам биномиального (нормального) распределения, известно, что в 68% случаев продажи будущего года будут лежать в пределах +/- 1SD от математического ожидания в 9,6 сделок, а в 90% случаев — в пределах +/- 1,645SD от матожидания. 3,07 сделок * 1,645 = 5,05 сделок, иными словами, в 90% случаев, работай мы весь следующий год с конверсией 2%, мы не выйдем за границы доверительного интервала «от 4,55 до 14,65 сделок». (Примечательно, что, обратно, в 1 случае из 10, мы, все-таки, выйдем за эти границы, по-прежнему, при этом, работая с «истинной» конверсией 2%.)

Любопытно, какой шум поднимет коммерческий директор, если по итогам года мы продадим всего 4 лимузина на 480 заявок, формально показав конверсию 0,83%... и еще более любопытно, что, статистически, это происходит в 1 из 27 отделов продаж. В одном из 27-ми случаев вас увольняют за невыполнение плана продаж, хотя вы по-прежнему работаете с «истинной» конверсией 2%.

Три конверсии на границе доверительного интервала

Как же тогда относится к результатам текущего года, где мы получили 4 сделки на 200 заявок?

Первый случай, «2,00%». Его мы рассмотрели сразу. 4 / 200 = 0,02, т. е. наша конверсия равна 2%. При этом, по законам биномиального распределения, все равно есть вероятность колебаться в 90%-м доверительном интервале «+/-1,645SD», т. е., в интервале от 0,74 до 7,26 сделок на 200 заявок.

Выглядит это примерно так:

Наш результат в 4 сделки совпал с математическим ожиданием от конверсии 2,0%, хотя, в общем, он мог и не совпасть, в целом находясь в 90% доверительном интервале от 1 до 7 сделок.

Второй случай, «1,22%». В этом случае, в реальности, наша «истинная» конверсия, на самом деле, ниже, и равна, например, 1,22%. Тогда матожидание числа проданных лимузинов примерно равно 2, и нам повезло сделать 4 продажи. Степень нашего везения такова, что сделать более 4 продаж мы могли бы только в 10% случаев. Т. е., мы остаемся в поле 90%-й вероятности, хотя и находимся на границе этого поля. Еще чуть-чуть, и нам повезет слишком сильно, а пока что нам везет «в пределах разумного»:

Третий случай, «3,31%». Теперь мы предположим, что в текущем году нам не везло, хотя весь год наша истинная конверсия была выше 2,0% и равнялась 3,31%. Матожидание для 200 заявок тогда равнялось бы примерно 6 проданным лимузинам, а сделать менее 4-х продаж было бы возможно лишь в 10% случаев. Тогда мы тоже остаемся в поле 90%-й вероятности, но находимся на левой границе этого поля с нашими невезучими 4 сделками.

Таким образом, приходится признать: мы не знаем наверняка, какая из 3-х конверсий — истинная. Нам привычно думать, что речь идет о 1-м случае, и мы делим 4 сделки на 200 заявок, получая конверсию 2,00%. Но никто не знает наверняка, является ли текущий год обычным или необычным, везло ли нам в нем, или не везло. В 90% случаев речь могла идти как о везении, и мы работали в действительности с конверсией 1,22%, так и о невезении, когда мы работали с конверсией 3,31%. Во всех 3-х случаях вероятность сделать 4 сделки на 200 заявок не выходила за границы 90%.

К сожалению, у нас пока слишком мало данных, чтобы утверждать что-то можно было более точно.

Нужно больше данных

Логично задать вопрос — а сколько нужно накопить данных, чтобы более-менее надежно говорить о конверсии 2,0%? Попробуем постепенно увеличивать размер выборки (число заявок, и, следовательно, продаж), пока не увидим, как 90%-й доверительный интервал сомкнется вокруг значения конверсии в 2,00%:

Заявки	Сделки	Нижняя граница 90% доверительного интервала (-1,645SD)	Верхняя граница 90% доверительного интервала (+1,645SD)	Нижняя граница конверсии	Верхняя граница конверсии
200	4	0,7	7,3	0,37%	3,63%
500	10	4,9	15,1	0,97%	3,03%
1 000	20	12,7	27,3	1,27%	2,73%
5 000	100	83,7	116,3	1,67%	2,33%
10 000	200	177,0	223,0	1,77%	2,23%
50 000	1 000	948,5	1 051,5	1,90%	2,10%
100 000	2 000	1 927,2	2 072,8	1,93%	2,07%
500 000	10 000	9 837,2	10 162,8	1,97%	2,03%
1 000 000	20 000	19 769,7	20 230,3	1,98%	2,02%
10 000 000	200 000	199 271,7	200 728,3	1,99%	2,01%
25 000 000	500 000	498 848,5	501 151,5	2,00%	2,00%

Надо ли говорить, что получить более нескольких десятков тысяч заявок-лидов может мало какой из отделов продаж. Поэтому, приходится признать, что ставить планы продаж и принимать кадровые решения относительно сотрудников, работающих с уровнями конверсии 1-5% — это безумие, и на таких маленьких числах математика в продажах не работает.

См. также:

http://italylov.ru/blog/all/ctatisticheskaya-dostovernost-koltrekinga/