Поскольку в этой и параллельной темах зашел разговор о дисперсии, теоретической
возможности автоматизации подобного метода оценки и т.п., посмотрим как наше визуальное восприятие «линейного жгута» сопрягается с конкретными числовыми показателями. Очевидно, что в подобных случаях человеческий глаз способен быстро вычленять на графике главное и отсекать лишнее. Поручение такой работы автоматическому средству, работающему, например, в оффлайне, требует указания достаточно конкретных параметров отбора сомнительных случаев игры.
ПОКАЗАТЕЛИДля этой цели была использована та же выборка из 12 партий и произведен расчет следующих показателей:
1. Диапазон номеров ходов партии, учитываемых при расчете производных показателей (M).
2. Среднее время на ход в партии (T).
3. Дисперсия времени на ход в партии (D).
4. Нормализованный показатель дисперсии (X).
Было выбрано три диапазона ходов партии:
- общее количество ходов в партии,
- ходы в диапазоне 1-25,
- ходы в диапазоне 6-25.
Альтернативные диапазоны не рассматривались и не рассчитывались. Таким образом, это в определенной мере случайные, выбранные из общих соображений диапазоны, а не специально подобранные под известный результат.
Показатели T и D рассчитывались с помощью стандартных функций Excel.
Показатель X рассчитывался по следующей формуле:
X = 5 * D / T, где коэффициент 5 представляет собой условное число, позволяющее привести этот показатель к одному масштабу с показателями T и D и тем самым построить удобный для восприятия график.
Формула условна и исходит из того, низкие значения дисперсии являются признаком для выявления сомнительных случаев игры и ее сигнальные функции более значимы при более высоких средних затратах на ход.
В табл.0 представлены все расчетные данные по 12 упомянутым партиям.

Табл.0
Примечание. В таблице исправлена опечатка, допущенная в предыдущей публикации, касающаяся указания цветов партнеров в партии 10. Правильно B-C вместо C-B. Данная опечатка не влияет на другие представленные материалы. В таблицах 1-4 представлены рассчитанные данные по всем партиям каждого игрока с разными вариантами сортировки. Для каждой таблицы построен соответствующий график (см. рис.1-4).
ВЫВОДЫПервые наблюдения позволяют сформулировать следующие предварительные выводы для автоматического отбора сомнительных случаев:
1. Судя по всему, данный метод может позволить отбирать из массового потока сомнительные случаи, но анализ и оценку этих случаев должен делать человек.
2. Нет необходимости подключать человека для каждого сомнительного случая. Достаточно собирать статистику и первичные данные таких случаев и анализировать тогда, когда их количество по конкретному игроку превышает некий достоверный порог. Для этого достаточно иметь перед глазами сводный отсортированный список таких случаев в разрезе игроков.
3. Нет необходимости рассчитывать все партии подряд. Можно установить некоторые фильтры: например, длина партии должна составлять не менее 30-40 ходов, учитывать партии только с ограниченным перечнем контроля времени.
4. Возможно, потребуются поправочные коэффициенты на контроль времени, в том числе с фишером или компенсацией.
5. Лучшие результаты дает использование определенного диапазона номеров ходов («окна»). Возможно использование нескольких, но более узких «окон». Это фактор имеет важное значение, поскольку в блицах (и не только) к концу партии скорость игры обычно заметно увеличивается.
6. Улучшению сигнальной функции показателей может способствовать отсечение нескольких минимальных и максимальных значений первичных данных. Возможно, имеет смысл отсекать только максимальные значения, поскольку именно высокие, хотя и редкие, максимальные значения существенно искажают сигнал. Предполагается, что такая мера может позволить повысить устойчивость и информативность поведения критерия отбора.
7. Необходимо подобрать оптимальный уровень критерия отбора. В силу огромного числа играемых партий выбранный показатель должен иметь весьма жесткий пороговый уровень для предотвращения ложного срабатывания и отбора слишком большого числа сомнительных случаев. С другой стороны, важно не переусердствовать в этом стремлении. Единичные случаи не позволят эффективно использовать статистический потенциал такой селекции.
8. Для серьезной разработки этого метода необходим другой объем выборки и более глубокий анализ, но это уже иная задача. Здесь представлена только примерная иллюстрация аналитических возможностей данного подхода.
ИЛЛЮСТРАЦИИ
Табл.1 Сортировка по столбцу D (ходы: все)

Табл.2 Сортировка по столбцу D (ходы: 1-25)

Табл.3 Сортировка по столбцу D (ходы: 6-25)

Табл.4 Сортировка по столбцу X (ходы: 6-25)

Рис.1 Сортировка по столбцу D (ходы: все)

Рис.2 Сортировка по столбцу D (ходы: 1-25)

Рис.3 Сортировка по столбцу D (ходы: 6-25)

Рис.4 Сортировка по столбцу X (ходы: 6-25)
Это сообщение отредактировал zenker - 21/01/2007, 18:04