- Выберите Пирсона, Спирмена или Кендалла в зависимости от формы игры, нормальности и размера лагеря.
- Для различных категорий используйте chi-quadro/Fisher и выберите ассоциацию с V di Cramer или φ.
- Valuta confondenti con correlazione parziale и поддерживает анализ с графиками и диагностикой.
- Алгебра отношений (insiemi, funzioni, composizione) структурирует мысли и приложения в базе данных.

Если вы хотите, чтобы тип закона был переменным, это наиболее часто задаваемые вопросы в статистических приложениях, науке о данных, экспериментальных и количественных исследованиях . Обратная связь линейна и всегда является частью cogliere, другая обратная дорога монотонна, но нелинейна, является категорией oppup coinvolge и не является числом, якорь зависит от третьей переменной, которая согласовывает le acque: insomma, non è una passeggiata.
В этом практическом и теоретическом руководстве на итальянском языке мы рассмотрим в органическом режиме основные математические взаимосвязи между переменными , такие как визуальная диагностика и использование формальных тестов, качественные коэффициенты (Пирсона, Спирмена, Кендалла), коэффициенты для множественных переменных (критерий независимости, критерий Фишера, критерий Крамера, коэффициент случайности, фи), измерение согласия с помощью коэффициента Каппа, а также способы управления изменчивостью согласия для обработки корреляции между отдельными переменными. Кроме того, мы рассмотрим основы алгебры отношений (в семистическом и вычислительном смысле), необходимые для формализации таких понятий, как область определения, композиция, обратные функции и функции.
Что мы имеем в виду под «relazione» из-за изменчивости
На математическом языке отношение R между A и B представляет собой sottoinsieme декартова продотто A×B : копия ординаты (a, b), видимая для R, указывает, что элемент a di A находится «в отношениях» с элементом b di B. В терминах применения отношение può essere deterministica (funzione) oppure probabilistica (associazione stochastica): в первом случае ad ogni aсоответствует esattamente un b, во-вторых, мы обслуживали тенденцию (большую или менее сильную), а не легам уно-а-уно.
Все внутренние алгебраические отношения (в инсиемическом смысле) представляют собой интересные свойства, такие как riflessivity (ogni a è по отношению к этому отношению), симметрия ((a, b) подразумевает (b, a)), антисимметрия (если (a, b) и (b, a), то a = b) и транзитивность (da (a, b) и (b, c) следует из (a, w)). Это свойство имеет решающее значение: если отношение является комплексным, симметричным и транзитивным , оно выявляет отношение эквивалентности , которое «разделяет» A на классы эквивалентных элементов. Если invece является riflessiv, антисимметричным и транзитивным, мы имеем отношение порядка.
В этом анализе мы воплощаем эту идею на практике: оцениваем тип изменчивости (количественные континуумы, порядковые, номинальные/дикотомические) и классификацию в статистических целях и адекватных инструментах для неправильного определения связи, зная, что «связь» не всегда означает «причина-следствие».
Визуальное описание: рисунок и направление риконосцере.
Прежде всего, не было цифр, графическое изображение было очень интеллектуальным. Облако вдоль прямой линии предполагает линейную зависимость (положительную или отрицательную); структурируйте кривую, указывающую на нелинейные зависимости (но монотонные). Если вы не внедрите шаблон, линейная связь может разрушить согласие.
При значениях переменных диаграмма рассеяния pannelli (и пример в R с парами (dati) ) и сглаживающая линия тренда (geom_smooth в ggplot2) могут помочь отметить ассоциации, кластеры и выбросы . Внимание: выбросы могут вызывать молозиво и коэффициенты гриппа, виды Пирсона.
Например, в R можно начать так: pairs(dati)
# Matrice di grafici a dispersione
pairs(dati)
# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")
Первичный визуальный осмотр, скорректированный по числовому значению, помогает контролировать ход теста на основе формы, монотонности и кажущейся линейности.
Проверьте его нормальность: при подаче давверо
Параметрический тест (как и тест Пирсона) предполагает в некоторых случаях нормальное или симметричное строение без тяжелого кода. Для контроля ипотеки используйте часть графических инструментов в виде гистограмм с плотностью и графиком QQ.
В языке R минимальный набор необходимых компонентов может включать:
# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
hist(x, prob = TRUE)
lines(density(x), col = "red")
curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)
Для сравнения наблюдаемых величин со стандартным нормальным значением QQ-график не является обязательным:
par(mfrow = c(2, 2))
qqfun <- function(x) {
qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)
Ввиду этого, если я не могу использовать формальный тест на нормальность для накопления доказательств: тест Колмогорова-Смирнова со статистическими параметрами, тест Лиллифорса, тест Крамера-фон Мизеса, тест Шапиро-Уилка, тест Шапиро-Франса, тест Андерсона-Дарлинга и тест Пирсона (хи-квадру).
normalita <- function(x) {
t1 <- ks.test(x, "pnorm", mean(x), sd(x)) # Kolmogorov–Smirnov
t2 <- nortest::lillie.test(x) # Lilliefors
t3 <- nortest::cvm.test(x) # Cramér–von Mises
t4 <- shapiro.test(x) # Shapiro–Wilk
t5 <- nortest::sf.test(x) # Shapiro–Francia
t6 <- nortest::ad.test(x) # Anderson–Darling
t7 <- PearsonDS::pearson.test(x) # Pearson chi-quadro di normalità
pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)
Если исходные данные относятся к нормальному распределению и зависимость линейная , то коэффициент Пирсона является хорошим предварительным выбором; в противном случае целесообразнее использовать комбинацию коэффициентов Спирмена или Кендалла.
Связь между количественной изменчивостью: ковариация и корреляция
Проблема заключается в том, что ковариация зависит от смешанной единицы , что делает ее малопригодной для сравнения.
Линейная корреляция Пирсона решает проблему стандартизации стандартного отклонения: коэффициент r варьируется от -1 до 1, при этом значения ±1 указывают на сильную линейную зависимость (положительную или отрицательную), а 0 — на линейность. Внимание: r = 0 не исключает нелинейных зависимостей.
Расчет корреляции для каждого показателя в R:
# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")
Когда взаимосвязь монотонна, но нелинейна или когда она ненормальна (выброс), есть смысл использовать Спирмена (ранги; устойчивый и адаптированный к средним и крупным кампионам) или Кендалла τ (базато су concordanze/discordanze; предпочтительнее su Campioni piccoli или con molti pareggi):
# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")
# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")
Полезная идея: коэффициент для определения R² в линейной модели без линейного восстановления переменной скорости Y spiegata из X. В R:
summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared
Для дихотомической и количественной изменчивости точечно-бисериальный коэффициент совпадает с расчетом Пирсона с кодированной переменной 0/1; на практике используется cor(dichotomous, quantitative) с method = “pearson”.
Категории переменных: indipendenza, сила ассоциации и пикколи кампиони.
Когда в дело вступает изменчивость номинального или порядкового сна , взаимосвязь изучается с помощью таблицы сопряженности (частота с доппийной классификацией). Типичная гипотеза: H0 = indipendenza (необходимая ассоциация), контрольная H1 = dipendenza.
Для проверки различий используется модель хи-квадрат независимого распределения . Если продолжительность вашей сна часто ниже этого значения (обычно < 5), если вы используете корреляцию Йейтса для 2×2 или проходите тест Фишера , что особенно важно при наличии Campioni piccoli.
# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL) # p-value non significativo => indipendenza plausibile
# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)
Для количественной оценки интенсивности ассоциации в таблице I×J используются: коэффициент Крамера (0–1), коэффициент сопряженности (0–1, ограничение), а в таблице 2×2 — коэффициент Фи (φ) , который формально является применением коэффициента корреляции Пирсона к бинарной таблице.
# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2) # riporta V di Cramér, coeff. di contingenza e test
# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale
Если целью является сравнение групп с количественными переменными (например, по профессиям на Reddit), и если используется оценочный тест ANOVA или соответствующая непараметрическая альтернатива, то доверительный интервал отсутствует. В целом, это соответствует типу изменчивости, и метод является фундаментальным.
Accordo tra valutatori: Каппа ди Коэн
Когда должное (più) giudici классифицирует gli stessi oggetti по категориям, недостаточно смешать процент согласия, в этом случае существует квота può essere dovuta . Il Kappa di Cohen количественно определяет правильное согласие для случайного согласия: я оцениваю его дальше до 0, указывая на согласие pari al caso, я ценю его в большей степени, предполагая возрастающее согласие (interpretazioni comuni: Scarso, Discreet, Moderato, Good, molto Good).
В R можно оценить каппу anche в versione ponderata (по порядковой категории):
set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)
# Kappa non ponderato
fmsb::Kappa.test(val1, val2)
Если категория не является необычайно естественной (а иногда и умеренной/тяжелой), Каппа считает, что в случаях разногласий штраф за «незначительные» и «незначительные» случаи наказывается гораздо более информативным.
Соотношения и переменные путаницы: парциальная корреляция
Può capitare che from the variabile Под вопросом, если вы вычислите корреляцию между X и Y с учетом Z.
В R с помощью ggm::pcor можно определить парциальную корреляцию первичного порядка и можно проверить значимость. Полезно сравнить классику и парциале на капире как Z «spiega» del legam grezzo.
library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))
# Correlazione grezza
r <- cor(dati$GASLAZER, dati$GASAUDE)
# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))
# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)
Если в процессе контроля происходит «закручивание ручейка», то Аллора Z оказалась важным партнером . Когда контрольной переменной является категория (например, профессия), я не могу использовать аналогичные подходы или модели, которые включают категорию в качестве фактора.
Ограничение и хорошая практика использования корреляции
Коэффициент Пирсона учитывает только линейные зависимости . Если зависимость нелинейная (квадратичная, спонтанная, логарифмическая), он может быть равен 0 при наличии сильной зависимости. В этом случае значения коэффициента Спирмена равняются , что соответствующим образом преобразует нелинейную модель.
Gli outlier podeno distorte parecchio il resultato. По этой причине, прежде всего, целесообразно проверить график и, при необходимости, провести робастный анализ или проверить чувствительность результата при исключении экстремальных точек.
Еще одна классика: корреляция ≠ причинность . Из-за изменчивости я не могу коррелировать, что грипп перше-сон дает третий фактор, простое совпадение или эффект обратного механизма. Экспериментальные сервоприводы, причинные инструменты или модели, подходящие для обсуждения причинно-следственных связей.
Тип связи: линейная, монотонная, нулевая, категориальная
Это часто бывает смешанным (количественный против дихотомического/номинального/обычного), если оно становится тестом сравнения между группами, бисериальными/точечно-бисерийными корреляциями или моделью (и примером регрессии с прогностическими факторами). С переменными категориями , ci si affida a chi-quadro/Fisher и все недостатки силы ассоциации, которую я вижу.
Фунциони едят особые отношения
Функция — это отношение, которое для одного элемента области определения тесно связывает один элемент области значений. В заключение, это sottoinsieme di A×B tale, что ogni a in A сравнивает a sole volta с первой компонентой. Другие важные операции в алгебре этого отношения: объединение (R1 ∪ R2), пересечение (R1 ∩ R2), композиция (R2 ∘ R1) и обратная операция (R^{-1}, которая является простой копией (a, b) в (b, a)).
Questi mattoni концептуальные торнано с использованием чистой математической (эквивалентности, ордини, класса эквивалентности) в конкретных приложениях служат формализацией отношений между объектами.
Алгебра отношений и наука, которую я дал
В мире баз данных относительная алгебра — это теоретическая структура SQL: операции, такие как selection, proiezione, join, unione и intersezione versioni pratiche di operazioni su relative-insiemi. Эта формализация является мощным инструментом для быстрого описания, оптимизации и манипулирования данными.
В контексте искусственного интеллекта и машинного обучения способность моделировать взаимосвязи между сущностями позволяет экономически эффективно создавать знания, системы рекомендаций и конвейеры интеграции; эта ценность справедлива в экономике, биостатистике и социальных науках, она почти всегда « chi è legato a chi, e in che mode ».
Классические примеры взаимосвязей в теории инсиэми
Отношение эквивалентности : реалистический, симметричный и транзитивный сон. Некоторые типичные примеры включают «авере ло стессо доблесть ассолуто» в реальности или в соответствии с модулями и внутри. Отношение эквивалентности Ogni порождает classi di equivalenza , который rippartiscono l'insieme in blocchi disgiunti.
Relazioni d' ordine : нарезное, антисимметричное и переходное. Примеры: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle parti P(X), o «разделить» (|) sui naturali. Соно фундаментально для определения общих порядков или частей и для соединения больших, минимальных, катеновых и антицепей.
Лессикография порядка : то, что я и говорил. Это порядок в последовательности (строке, числе, записанном последовательно), который сравнивает элементы по одному; в этой структуре присутствует значительный шум, и я пренебрегаю алгоритмами.
Этот раздел полезен тем, что «отношения» в математике являются основным понятием единственной корреляции : включают в себя числа, ордины, композицию и многое другое, все это необходимо для моделирования комплексных систем.
Практический рабочий процесс: контролируйте результаты
Возможно обеспечить бесперебойное выполнение работы во время строительства, и иногда это приводит к следующим результатам:
- Графический осмотр: диаграмма рассеяния, сглаживание, изограммы, QQ-график. Это выброс и форма нелинейная.
- Чеки: если работает, проверить нормальность; Controlli di omoscedasticità, если предусмотрена линейная модель.
- Scelta del factore: Пирсон (линейный, данные около нормали), Спирмен/Кендалл (монотонный/ненормальный/пикколи кампиони).
- Категорический: хи-квадро/Фишера + ошибка ассоциации (V ди Крамера, коэффициент случайности, φ). Для группового сравнения используйте t-тест/ANOVA или альтернативный вариант.
- Конфунденти: коррелировать парциальную или многомерную модель (включая категорию фаттори).
Qualunque sia la scelta, интерпретация конкурса и игра: грандиозный эффект, значительная статистика, усиление турнира и качество данных, которые содержатся в финале (не больше) числа.
Esempi di codice R ricorrenti
Вкратце, вы можете использовать этот метод для повышения точности анализа взаимосвязи между переменными, а затем адаптировать его к своему набору данных:
# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")
# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)
# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)
# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab) # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab) # V di Cramér e coeff. di contingenza
# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)
# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))
Практическое замечание : le scelte “giuste” dipendono dai dati. Стоит проверить гипотезу, сравнить метод и, если он сработает, составить небольшой скрипт для быстрой и надежной диагностики вопроса.
Мы заметили, что «relazione» чаще всего означает: линейную форму с Пирсоном, монотонность со Спирменом/Кендаллом, тонкую ассоциацию внутри категории с хи-квадру/Фишером и измерение с V ди Крамером и φ; senza dimenticare — согласие между giudici (Kappa) и управлением, которое я дал confondenti с частичной корреляцией. Следовательно, реляционная алгебра fornisce i mattoni concettuali per defining domain, inverse and composition, between the relational algebra guides the mode in which I archive and interroghiamo i dati nei database. Идея состоит в том, чтобы выбрать инструмент на базе всех типов переменных, в форме закона и в целях анализа , фиксировать отсутствие коэффициентов, да только, и можно рассказать всю историю.