- Vyberte si Pearsona, Spearmana nebo Kendalla na základě formy hry, normálnosti a velikosti šampionátu.
- Podle různých kategorií usa chi-quadro/Fisher e misura l'associazione con V di Cramér o φ.
- Valuta concondenti con correlazione parziale a podporuje analýzu pomocí grafiky a diagnózy.
- Vztahová algebra (insiemi, funzioni, composizione) strukturuje pensiero a aplikaci v databázi.
Capire che typ legam c'è tra due variabili Je to jeden z nich, který nejčastěji dominuje ve statistických aplikacích, datech z dat a experimentálních testů a kvantitativníOpačný vztah je lineární a vždy součástí koglière, další cesta zpět je monotónní, ale nelineární, naproti tomu koinvolge category a non-numeri, kotva závisí na třetí proměnné, která spočívá v příčině: nepořádek, nechodec.
V tomto praktickém a teoretickém průvodci v italštině se o tom budeme bavit v organickém režimu. Hlavní tip matematických vztahů kvůli variabilitě, jak vizuálně diagnostikovat a pomocí formálního testu, použité kvalitativní koeficienty (Pearson, Spearman, Kendall), jak se měnit s variabili kategorickými proměnnými (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, koeficient di contingenza, phi), jak zmírnit dohodu práce s Kappou a jak ji zvládat proměnné zmatku zpracovat korelaci Parziale. Inoltre, vylepšíme jižní finestrualgebra vztahů (v insiemistickém a výpočetním smyslu), essenziale per formalizzare concetti come domain, composition, inversa a funzioni.
Co zamýšlíme jako „relazione“ kvůli variabilitě
V matematickém jazyce je vztah mezi A a B shrnutí kartézského součinu A×B: ogni coppia ordinata (a, b) appartenente a R označuje, že prvek a di A je „ve vztahu“ s prvkem b di B. In termini applicati, vztah, který je deterministický (funkce) oppure probabilistica (associazione stochastica): v prvním případě ad ogni a koresponde esattamente una b, v druhém osserviamo una trend (più nebo méně silné) a non un legam uno-a-uno.
Veškerá „vnitřní algebra vztahů (v siemistickém smyslu) je zajímavá proprietà come“ riflessività (ogni a è ve vztahu k sobě samému), symetrie ((a, b) implikuje (b, a)), antisymetrie (pokud (a, b) a (b, a) nebo a = b) a tranzitivita (z (a, b) a (b, c) vyplývá (a, c)). Tento klíčový vlastník nemovitosti: Pokud je vztah symetrický, symetrický a tranzitivní diventa una relace ekvivalence che „partiziona“ A in classi di elementi ekvivalenti. Pokud je invece riflessivní, antisymetrická a tranzitivní, my abbiamo una relacione d'ordine.
V této analýze tuto myšlenku převádíme do praxe: vyhodnocujeme typ variability (kvantitativní pokračování, ordinali, nominali/dicotomiche) a tam umístění v této statistice a scegliamo strumenti adeguati per misurare la relazione s vědomím, že „relazione“ neznamená vždy „příčina-následek“.
Vizuální ispezione: jíst riconoscere vzor a směr
Prima di buttarsi nei numeri, un bodový graf Je to tíha té nejinteligentnější věci. Mrak táhnoucí se celou délkou přímé čáry naznačuje... lineární vztah (kladné nebo záporné); strukturovat indikativní křivku nelineární vztahy (ma magari monotónní). Pokud neprovedete intravední vzorec, lineární vztah může zničit souhlas.
S malou variabilitou jsem použil bodový graf (a například v R s páry (data)) a čára, která má tendenci se zplošťovat (geom_smooth v ggplot2), takže si můžete všimnout asociace, shluky a odlehlé hodnotyPozor: gli odlehlá hodnota Poděná influenzare moltissimo i koeficient, druh Pearson.
Například v R si può iniziare così: páry (data)
# Matrice di grafici a dispersione
pairs(dati)
# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")
První vizuální prohlídka, s přesností na daný počet, Přejít na scegliere il test giusto založené na formě, monotónnosti a zdánlivé linearitě.
Zkontrolujte jeho normálnost: při podávání davvero
Parametrický Moltiho test (například Pearsonova testu) předpokládám v různé míře, normálnost Almeno je symetrická struktura bez náročného kódu. Pro řízení hypotézy je použita specifická část grafické struktury. zkratky s hustotou e QQ-graf.
V R, una minimální kapacita baterie potřebné zahrnuje:
# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
hist(x, prob = TRUE)
lines(density(x), col = "red")
curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)
Pro porovnání kvantitativních pozorování s pozorováními běžného standardu, QQ-graf jsou nezastupitelné:
par(mfrow = c(2, 2))
qqfun <- function(x) {
qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)
Měj to na očích, když to nemůžu použít formální test normálnosti podle akumulačních důkazů: Kolmogorov–Smirnov s odhady parametrů, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–Francia, Anderson–Darling e il test di Pearson (chi-quadro) di normalità.
normalita <- function(x) {
t1 <- ks.test(x, "pnorm", mean(x), sd(x)) # Kolmogorov–Smirnov
t2 <- nortest::lillie.test(x) # Lilliefors
t3 <- nortest::cvm.test(x) # Cramér–von Mises
t4 <- shapiro.test(x) # Shapiro–Wilk
t5 <- nortest::sf.test(x) # Shapiro–Francia
t6 <- nortest::ad.test(x) # Anderson–Darling
t7 <- PearsonDS::pearson.test(x) # Pearson chi-quadro di normalità
pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)
Pokud spím zhruba normálně a vztah je lineárníPearsonův koeficient je dobrým keltským bratrancem; jinak je rozumné dát přednost smíchání basate sui ranghi se Spearmanem nebo Kendallem.
Vztah mezi kvantitativní variabilitou: kovariancí a korelací
La kovariance Problém je v kovarianci závislé na jednotce misy, pak je to trochu srovnatelné.
La Pearsonova lineární korelace Vyřešte problém standardizace na směrodatnou odchylku: koeficient r se pohybuje mezi -1 a 1, což dává hodnotu ±1. silná lineární relace (pozitivní nebo negativní) a 0 naznačuje assenza di linearità. Poznámka: r = 0 nevylučuje nelineární vztahy.
Výpočty pro korelace v R:
# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")
Kdy je vztah monotónní, ale nelineární nebo když normálně nespím (nebo neobsahuji odlehlou hodnotu), má smysl používat Spearman (ranghi; robustní a přizpůsobené pro medio-grandi campioni) Kendall τ (basato su concordanze/discordanze; preferibile su malí šampioni (nebo s mnoha páry):
# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")
# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")
Užitečná myšlenka: koeficient determinace R² z jednoho jednoduchý lineární model lineárně obnovuje variabilní podíl Y spiegata z X. V R:
summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared
Dichotomie per variabili vs. kvantitativní, koeficient bodový biseriál shoduje se s Pearsonovým výpočtem s kódovanou proměnnou 0/1; v praxi barva (dichotomická, kvantitativní) metoda con = „pearson“.
Kategorie proměnných: indipendenza, síla asociace a piccoli campioni
Když se objeví variabilita spánku nominální nebo ordinální čísla, vztah, pokud studium s tabulka kontingencí (často s klasifikací doppia). Typická ipotesi je: H0 = indipendenza (nutná asociace), kontrola H1 = dipendenza.
Zkouška náboje je jeho chí-kvadra nezávislostiJsi to ty často útočí troppo basse (obvykle < 5), pokud jej používáte Yatesova oprava na 2×2 nebo pro průchod Fisherův testovací esatto, zvláště vhodné s campioni piccoli.
# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL) # p-value non significativo => indipendenza plausibile
# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)
Na kvantitativní péči l'intensità dell'associazione v tabulce I×J se používá: V di Cramér (0 – 1), koeficienty kontingence (0–1, omezení) a v 2×2 il fí (φ), což je formálně Pearson applicato alla tabella binaria.
# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2) # riporta V di Cramér, coeff. di contingenza e test
# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale
Se l'intersse je konfrontováno skupiny, její kvantitativní variabilita (es. reddito per professione), je-li valutano t-test, ANOVA e le rispettive alternative non parametriche, no intervalli di confidenza. Obecně, koherence v typu variability a metodě je kritický.
Accordo tra valutatori: Kappa di Cohen
Když náležité (nebo più) giudici zařadí no gli stessi oggetti do kategorie, nestačí smíchat procento shody, perché a kvóta può essere dovuta al případ, to Kappa di Cohen kvantifikuje správnou shodu pro nezávaznou shodu: Hodnotil jsem dále na 0, což označuje shodu pro každý případ, hodnotil jsem maggiori suggeriscono rostoucí shoda (interpretazioni comuni: scarso, diskrétní, moderato, buono, molto buono).
V R è possibile stimare Kappa anche in počítáno (podle pořadových kategorií):
set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)
# Kappa non ponderato
fmsb::Kappa.test(val1, val2)
Pokud kategorie není přirozeným řádem (ad empio, lieve/moderata/severa), Kappa ponderato penalizza minor v nesouhlasu „vicini“ a più quelli „lontani“, což má za následek spesso più informativní.
Relazioni e variabili di confusione: la correlazione parziale
Può capitare che due variabili X e Y sembrino molto korelát, ale v realtà la force dell'associazione sia dovuta a una proměnná zmatku Z souvisí s entrabe. Pokud na něj kliknete, částečná korelace Řízení os X a Y podle osy Z.
V R, s ggm::pcor si ottiene la correlazione parziale di primo ordine e si può testne la significatività. Je užitečné porovnávat klasické r e r parziale na capire jako Z „spiega“ del legam grezzo.
library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))
# Correlazione grezza
r <- cor(dati$GASLAZER, dati$GASAUDE)
# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))
# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)
Pokud kvóta spiegata „crollas“ dopo il controllo, nyní Z byl důležitým společníkemPokud je řídicí proměnnou kategorie (např. profese), nemohu použít podobné přístupy nebo modely, které zahrnují kategorii jako faktor.
Limit a osvědčené postupy při používání korelace
Směs Pearsonových koeficientů pouze linearitaPokud je vztah nelineární (kvadratický, sponeční, logaritmický), může při silné závislosti vést k 0 bodům. V daném případě ohodnoťte. Spearman, čímž se transformuje do nelineárního modelu.
Gli outlier Nemohu zkreslit výsledek. Z tohoto důvodu je v první řadě vhodné zkontrolovat graf a v případě potřeby provést robustní analýzu nebo zároveň zkontrolovat citlivost výsledků.
Další klasika: korelace ≠ kauzalita. Vzhledem k variabilitě nemohu korelovat perché spánek influenzate dává třetí fattore, pouze náhoda nebo na účinek inverzního mechanismu. Servono disegni sperimentali, strumenti causali o modelli accurati per parlare di causa-effetto.
Typ vztahu: lineární, monotónní, nulový, kategoriální
Nei casi misti (kvantitativní vs dichotomica/nominale/ordinata) projde testem di konfrontace mezi gruppi, correlazioni biseriali/point-biserial oa modely (příklad regrese s predikovaným faktorem). S variabilitou kategorizace, ci si affida a chi-quadro/Fisher e alle misure di force dell'associazione già viste.
Funzioni jedí speciální vztahy
A funkce Je to vztah, který pro každý prvek domény asociuje přesně jeden prvek bytu. Závěrem lze říci, že je to spottoinsieme di A×B příběh, který ogni a v A porovnává jediný volta s první složkou. Další důležité operace v algebře související se spánkem: svaz (R1 ∪ R2), průsečík (R1 ∩ R2), composizione (R2 ∘ R1) a zvrátit (R^{-1}, che scambia ciascuna coppia (a, b) v (b, a)).
questi mattoni konceptuální tornádo využitelné v ní čistá matematika (ekvivalenze, ordini, classi di equivalenza) sia in applicazioni betonová holubice slouží formalizzare vztahy fra entità.
Dal jsem algebru vztahů a vědu
Ve světě databází, l'relační algebra Toto je teoretická struktura SQL: jak s ním pracovat select, proiezione, join, unione a intersezione sono versioni pratiche di operazioni su relazioni-insiemi. Tato formalizace je mocnou zbraní pro rychlé popisování, optimalizaci a manipulaci s věcmi.
V poli umělá inteligence a strojové učení, schopnost modelování vztahů umožnit konstrukci grafů konoscence, systémů doporučování a integračního kanálu; Tato hodnota je platná v ekonomii, biostatistice a sociálních vědách, je téměř vždy „chi je legato a chi a v režimu che".
Klasické příklady vztahů v teorii insiemiho
Vztahy ekvivalence: riflesivní, symetrický a tranzitivní spánek. Příklady zahrnující „mít tuto hodnotu jako řešení“ jsou skutečně reálné nebo existují shoda modulo n Navrhl jsem interně. Ogniho vztah ekvivalence indukuje třídy ekvivalence che ripartiscono l'insieme in blocchi disgiunti.
Relazioni d'ordinace: riflessive, antisimmetriche a tranzitive. Esempi: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle parti P(X), o „rozdělit“ (|) sui naturali. Fondamentální spánek podle definice úplné nebo částečné příkazy a pro každou oblast jsou uvedeny její massimi, minimi, kateny a antiřetězce.
objednávka lesikografickýTo jsem říkal. Je to pořadí v sekvenci (řetězec, číslo zapsané v sekvenci), které porovnává prvek po prvku; V této struktuře je důležitý šum a algoritmy zanedbávám.
Tato část je užitečná pro pochopení toho, že „relace“ v matematice je koncept più ampio della sole correlazione: zahrnují uguaglianze, ordini, kompozici a mnoho dalšího, vše nepostradatelné pro modelářský systém complessi.
Praktický pracovní postup: kontrolujte jeho výsledky
Možný pracovní proud takže to neztratíte, pokud používáte nástroj a kde:
- Grafická inspekce: bodový graf, vyhlazování, istogrammi, QQ-plot. Occhio a outlier e form non lineari.
- KontrolaPokud to funguje, otestujte normalitu; Pokud se předpokládá lineární model, otestujte normalitu.
- Výběr koeficientů: Pearson (lineare, dati circa normali), Spearman/Kendall (monotónní/non normale/piccoli campioni).
- Kategorický: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Pro skupinové srovnání t-test/ANOVA nebo jiný.
- Confundenti: korelační parziale nebo multivariační model (včetně kategorie fattori).
Zkoušíš, jak se ti táhne, interpretováno v kontextu Je to hlavní: grandezza dell'effetto, significative statistica, ampiezza del campione a qualità dei dati contano como (ne-li più) del numero finale.
Příklady kodexu R recorrenti
Už žádné hodnocení chiamate utili což umožňuje přesnější analýzu vztahu mezi proměnnými a které lze přizpůsobit vaší datové sadě:
# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")
# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)
# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)
# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab) # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab) # V di Cramér e coeff. di contingenza
# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)
# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))
Praktická poznámka: škrt „giuste“ závisí na datech. Stojí za to ověřit hypotézu, porovnat metodu a pokud funguje, vytvořit pikolový skript pro rychlou a spolehlivou diagnostiku otázky.
Abbiamo viděl, že „relazione“ může znamenat častěji než ne: lineární formu s Pearsonem, monotónnost se Spearmanem/Kendallem, řídkou asociaci v rámci kategorie s chi-quadro/Fisher a nespokojenost s V di Cramér a φ; senza dimenticare dohoda mezi giudici (Kappa) a managementem jsem uvedl concondenti s parziale korelací. Proto relační algebra fornisce i mattoni concettuali perdefine dominio, inversa e composizione, mentre relační algebra řídí režim, ve kterém archivuji a interroghiamo i dati nei databáze. Hlavní myšlenkou je scegliere lo strumento in base al type di variabili, alla form del legam e agli obiettivi dell'analisi, ricordandoci che nessun koeficient, da solo, può raccontare tutta la storia.