Tipovi matematičkih odnosa zbog varijabilnosti: teorija, testiranje i primjena

Zadnje ažuriranje: Studenoga 25, 2025
  • Odaberite Pearsona, Spearmana ili Kendalla na temelju forme igre, normalnosti i veličine campionaria.
  • Per variabili categoriali usa chi-quadro/Fisher e misura l'associazione con V di Cramér o φ.
  • Valuta confondenti con correlazione parziale i podržava analizu s grafikama i dijagnozom.
  • Algebra odnosa (insiemi, funzioni, composizione) strukturira pensiero i aplikaciju u bazi podataka.

odnos između varijabli

Capire che tip legam c'è tra due variabili To je jedan od njih koji najčešće dominira u statističkim primjenama, podacima iz podataka i eksperimentalnim testovima i kvantitativniObrnuti način odnosa je linearan i uvijek dio sidra, drugi način natrag je monoton, ali nelinearan, ili sidro koje se sastoji od kategorije i nebrojanih elemenata, sidro ovisi o trećoj varijabli koja kontrolira protok: nesklad, ne prolazi.

U ovom praktičnom i teorijskom vodiču na talijanskom jeziku, o tome raspravljamo na organski način Glavni savjet matematičkih odnosa zbog varijabilnosti, kako vizualno dijagnosticirati i s formalnim testom, korišteni kvalitativni koeficijenti (Pearson, Spearman, Kendall), kako mijenjati s varijabilnim kategoričkim varijablama (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, coefficiente di contingenza, phi), kako pomicati akorde rad s Kappom i kako njime upravljati varijable zbunjenosti obraditi parziale korelaciju. Osim toga, poboljšat ćemo južnjački finestraalgebra odnosa (u insiemističkom i računskom smislu), essenziale per formalizzare concetti come domain,position, inversa and funzioni.

Što namjeravamo za „relazione“ zbog varijabilnosti

U matematici, odnos između A i B je sažetak Kartezijevog produkta A×B: ogni coppia ordinata (a, b) appartenente a R označava da je element a di A "u odnosu" s elementom b di B. In termini applicati, odnos koji je deterministički (funkcija) oppure probabilistica (associazione stochastica): u prvom slučaju ad ogni a corresponde esattamente una b, u drugom slučaju osserviamo una tendenza (più ili manje jak) i non un legam uno-a-uno.

Sva 'unutarnja algebra odnosa (u siemističkom smislu) je zanimljiva sama po sebi pušaka (ogni a è u odnosu na sebe), simetrija ((a, b) implicira (b, a)), antisimetrija (ako (a, b) i (b, a) alora a = b) i tranzitivnost (iz (a, b) i (b, c) slijedi (a, c)). Ovaj ključni vlasnik nekretnine: ako je odnos simetričan, simetričan i tranzitivan postaje jedno odnos ekvivalencije che “partiziona” A in classi di elementi equivalenti. Ako je invece riflessivan, antisimetričan i tranzitivan, abbiamo una odnos reda.

U ovoj analizi, ovu ideju pretvaramo u praksu: procjenjujemo vrstu varijabilnosti (kvantitativni nastavak, ordinali, nominali/dicotomiche) i tamo mjesto u ovoj statistici i scegliamo strumenti adeguati per misurare la relazione, znajući da “relazione” ne znači uvijek “uzrok-posljedica”.

Vizualna ispezione: jesti riconoscere uzorak i smjer

Prima di buttarsi nei numeri, un dijagram raspršenja To je težina najinteligentnije stvari. Oblak cijelom dužinom ravne linije sugerira linearni odnos (pozitivno ili negativno); strukturirati indikativnu krivulju nelinearni odnosi (ma magari monotono). Ako ne uvedete obrazac, linearni odnos može uništiti pristanak.

S malom varijabilnosti, koristim dijagram raspršenja (i na primjer u R-u s parovi (podaci)) i linija koja teži smućenju (geom_smooth u ggplot2) tako da možete primijetiti asocijacije, klaster i outlierPažnja: gli outlier Podeno influenzare moltissimo i coefficienti, specie Pearson.

Na primjer u R si può iniziare così: parovi (podaci)

# Matrice di grafici a dispersione
pairs(dati)

# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")

Prvi vizualni pregled, točan do broja, Idi na scegliere il test giusto na temelju forme, monotonije i prividne linearnosti.

Provjerite njegovu normalnost: prilikom posluživanja davvera

Parametrički Moltijev test (npr. Pearsonov test) Pretpostavljam, u različitim stupnjevima, normalnost Almeno je simetrična struktura bez teškog koda. Za kontrolu hipotezija, dolazi određeni dio grafičke strukture istogrami s gustoćom e QQ-dijagram.

U R, una minimalna baterija potrebno uključuje:

# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
  hist(x, prob = TRUE)
  lines(density(x), col = "red")
  curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)

Za usporedbu kvantitativnih opažanja s onima normalnog standarda, QQ-dijagram nezamjenjivi su:

par(mfrow = c(2, 2))
qqfun <- function(x) {
  qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
  qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)

Drži to na vidiku, ako to ne mogu koristiti formalni test normalnosti po dokazu akumulacije: Kolmogorov–Smirnov s procjenama parametara, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–Francia, Anderson–Darling i Pearsonov test (chi-quadro) di normalità.

normalita <- function(x) {
  t1 <- ks.test(x, "pnorm", mean(x), sd(x))            # Kolmogorov–Smirnov
  t2 <- nortest::lillie.test(x)                         # Lilliefors
  t3 <- nortest::cvm.test(x)                            # Cramér–von Mises
  t4 <- shapiro.test(x)                                 # Shapiro–Wilk
  t5 <- nortest::sf.test(x)                             # Shapiro–Francia
  t6 <- nortest::ad.test(x)                             # Anderson–Darling
  t7 <- PearsonDS::pearson.test(x)                      # Pearson chi-quadro di normalità
  pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
  data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)

Ako spavam otprilike normalno i odnos je linearanPearsonov koeficijent je dobar keltski rođak; inače je razborito preferirati miješanje basate sui ranghi sa Spearmanom ili Kendallom.

odnose:  Papomude: Kako ih riješiti i vježbe

Odnos između kvantitativne varijabilnosti: kovarijance i korelacije

La kovarijanca Problem je kovarijansa ovisi od mjerne jedinice, onda je to malo usporedivo.

La Pearsonova linearna korelacija Riješite problem standardizacije po standardnoj devijaciji: koeficijent r varira između -1 i 1, dajući vrijednost do ±1. jaka linearna relacija (pozitivno ili negativno) i 0 sugerira assenza di linearità. Napomena: r = 0 ne isključuje nelinearne relacije.

Kalkulatori za korelacije u R-u:

# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")

Kad je odnos monotono ali nelinearno ili kada ne spavam normalno (ili ne mogu zadržati izuzetak), ima smisla koristiti Kopljanik (ranghi; robustan i prilagođen medio-grandi campioni) Kendall τ (basato su concordanze/discordanze; preferibile su mali prvaci (ili s mnogo parega):

# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")

# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")

Korisna ideja: koeficijent determinacije R² od jednog jednostavan linearni model linearno iz X vraća varijabilni udio Y spiegata. U R:

summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared

Dihotomija per variabili vs. kvantitativna, koeficijent točkasto-biserijski podudara se s Pearsonovim izračunom s kodiranom varijablom 0/1; u praksi, boja (dihotomna, kvantitativna) con metoda = “pearson”.

Promjenjive kategorije: indipendenza, snaga udruživanja i piccoli campioni

Kada se pojavi varijabilnost sna nominali ili ordinali, odnos ako studiraš s tablica uvjeta (često s doppia klasifikacijom). Tipični ipotesi je: H0 = indipendenza (potrebna asocijacija), kontrola H1 = dipendenza.

To je test riferimenta hi-kvadrat neovisnostiVidiš li koga? često udaraju tropo basse (obično < 5), ako ga koristite Yatesova korekcija po 2×2 ili ako prolazite Fisherov testni uzorak, posebno indicirano s campioni piccoli.

# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL)  # p-value non significativo => indipendenza plausibile

# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)

Po kvantnoj skrbi l'intensità dell'associazione u tablici I×J ako se koristi: V di Cramér (0-1), koeficijenti kontingenta (0–1, ograničenje), a u 2×2 il fi (φ), koji je formalno Pearson applicato alla tabella binaria.

# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2)  # riporta V di Cramér, coeff. di contingenza e test

# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale

Kad se interferencija suoči s grupe njegovu kvantitativnu varijabilnost (es. reddito per professione), ako je valutano t-test, ANOVA e le rispettive alternative non parametriche, no intervalli di confidenza. općenito, koherentnost u vrsti varijabilnosti i metodi je kritičan.

odnose:  Mjere centralne tendencije za grupirane podatke

Accordo tra valutatori: Kappa di Cohen

Kada due (ili più) giudici klasificiraju no gli stessi oggetti u kategoriju, nije dovoljno miješati postotak slaganja, perché a quota può essere dovuta al slučaj, to Kappa di Cohen kvantificira ispravno slaganje za ležerno slaganje: dodatno sam vrednovao do 0 što označava slaganje za svaki slučaj, vrednovao sam maggiori suggeriscono rastući dogovor (interpretazioni comuni: scarso, diskretno, moderato, buono, molto buono).

In R è possibile stimare Kappa anche in ponderirane verzije (po rednoj kategoriji):

set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)

# Kappa non ponderato
fmsb::Kappa.test(val1, val2)

Ako kategorija nije prirodni poredak (ad empio, lieve/moderata/severa), Kappa ponderato penalizza minor u neslaganju “vicini” i più quelli “lontani”, što rezultira spesso più informative.

Relazioni e variabili di confusione: la correlazione parziale

Può capitare che due variabili X e Y sembrino molto correlate, but in realtà la strength dell'associazione sia dovuta a una varijabla zbunjenosti Z povezano s entrabe. U pitanju je, ako kliknete na njega djelomična korelacija upravljanje X i Y prema Z.

U R, s ggm::pcor si ottiene la correlazione parziale di primo ordine e si può testne la significatività. Korisno je usporediti klasični r e r parziale per capire kao Z “spiega” del legam grezzo.

library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))

# Correlazione grezza
r  <- cor(dati$GASLAZER, dati$GASAUDE)

# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))

# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)

Ako spiegata kvota “crollas” dopo il controllo, sada Z je bio važan saveznikKada je kontrolna varijabla kategorija (npr. profesija), ne mogu koristiti slične pristupe ili modele koji uključuju kategoriju kao faktor.

Ograničenje i dobra praksa u korištenju korelacije

Mješavina Pearsonovih koeficijenata samo linearnostAko je odnos nelinearan (kvadratni, sponeziološki, logaritamski), može rezultirati s 0 bodova u prisutnosti jake ovisnosti. U tom slučaju, vrijednosti Kopljanik, pretvarajući ga u nelinearni model.

Gli van neke zajednice Ne mogu iskriviti rezultat. Zbog toga je, prije svega, praktično pratiti podatke, izrađivati ​​grafove i, ako je potrebno, istovremeno provoditi robusnu analizu ili provjeravati osjetljivost rezultata.

Još jedan klasik: korelacija ≠ uzročnost. Zbog varijabilnosti ne mogu povezati perché influenzate sna daje treću fattore, puku slučajnost ili po učinku inverznog mehanizma. Servono disegni sperimentali, strumenti causali ili modelli appropriati per parlare di causa-effetto.

Vrsta odnosa: linearni, monoton, nulti, kategorički

Nei casi misti (kvantitativno nasuprot dichotomica/nominale/ordinata) prolazi test di konfrontacije između gruppi, correlazioni biseriali/point-biserial oa modeli (primjer regresije s predviđenim faktorima). S varijabilnosti ulazak u kategorije, ci si affida a chi-quadro/Fisher e alle misure di strength dell'associazione già viste.

Funzioni jedu posebne odnose

Una funkcija To je odnos koji, po jednom elementu domene, povezuje točno jedan element kondominija. Zaključno, to je suptilna priča o A×B koja uspoređuje jedini volta s prvom komponentom. Ostale važne operacije u algebri vezanoj uz spavanje: Unija (R1 ∪ R2), križanje (R1 ∩ R2), sastav (R2 ∘ R1) i obrnuti (R^{-1}, che scambia ciascuna coppia (a, b) u (b, a)).

To konceptualni mattoni tornano utili sia nella čista matematika (equivalenze, ordini, classi di equivalenza) sia in applicazioni betonska golubica služi formalizzare odnosima fra entità.

Algebra odnosa i znanost koju sam dao

U svijetu baze podataka, l'relacijska algebra Ovo je teorijska struktura SQL-a: kako funkcionira odabir, proiezione, join, unione i intersezione sono versioni pratiche di operazioni su relazioni-insiemi. Ova formalizacija moćno je oružje za brzo opisivanje, optimiziranje i manipuliranje stvarima.

odnose:  Čemu služe brojevi? 6 glavnih namjena

U opsegu umjetna inteligencija i strojnog učenja, sposobnost modeliranja odnosa među njima omogućuje isplativu izgradnju znanja, sustava preporuka i procesa integracije; ova vrijednost vrijedi u ekonomiji, biostatistici i društvenim znanostima, gotovo je uvijek „chi je legato a chi, i to u načinu che".

Klasični primjeri odnosa u teoriji insiemija

Veze s ekvivalencija: fleksivni u snu, simetrični i tranzitivni. Primjeri uključujući „imati ovu vrijednost kao rješenje“ su stvarno stvarni ili postoje kongruencija po modulu n Predložio sam interno. Ognijev odnos ekvivalencije inducira klasa ekvivalencije che ripartiscono l'insieme in blocchi disgiunti.

Relacijeordina: riflessive, antisimetriche i transitive. Primjeri: ≤ sui naturali numeri, l'inclusione ⊆ sull'insieme delle parti P(X), ili “divide” (|) sui naturali. Temeljni san po definiciji ukupnih ili djelomičnih naredbi a po regiji su njegovi massimi, minimi, kateni i antilanci.

red lesikografski: to sam i rekao. To je redoslijed u nizu (niz, broj zapisan u nizu) koji uspoređuje element po element; U ovoj strukturi postoji važan šum, a ja zanemarujem algoritme.

Ovaj odjeljak je koristan za razumijevanje da je „relazione“ u matematici koncept più ampio della sole correlazione: uključuje uguaglianze, ordini, sastav i još mnogo toga, sve neophodno za modellare system complessi.

Praktični tijek rada: kontrolirajte rezultate

Moguće radni tok tako da ga ne izgubiš ako instrumentiraš i gdje:

  • Grafički pregled: dijagram raspršenosti, izglađivanje, istogrami, QQ-plot. Occhio a outlier e forma non lineari.
  • Provjeriti: ako radi, testirati normalnost; Kontrole omoscedasticità ako je predviđen linearni model.
  • Scelta del coefficiente: Pearson (lineare, dati circa normali), Spearman/Kendall (monotona/non normale/piccoli campioni).
  • Kategoričan: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Za grupnu usporedbu, t-test/ANOVA ili alternativa.
  • Zbunjeni: correlate parziale ili multivarijantni model (uključujući kategoriju fattori).

Slušam tvoju grešku, tumačenja u kontekstu To je chiave: grandezza dell'effetto, significative statistica, ampiezza del campione e qualità dei dati contano como (ako ne i più) del numero finale.

Primjeri koda R za prikupljanje

Riassumendo alcune komunalna tvrtka Chiamate što ga čini točnijim u analizi odnosa između varijabli i koji se može prilagoditi vašem skupu podataka:

# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")

# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)

# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)

# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab)  # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab)  # V di Cramér e coeff. di contingenza

# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)

# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))

Praktična napomena: oznaku „giuste“ temeljenu na podacima. Vrijedi potvrditi hipotezu, usporediti metodu i, kada ona funkcionira, konstruirati pikolo skriptu za brzo i pouzdano dijagnosticiranje pitanja.

Abbiamo je vidio da “relazione” može značiti češće nego ne: linearna forma kod Pearsona, monotonija kod Spearmana/Kendalla, tanka all'asocijacija unutar kategorije kod chi-quadro/Fisher i misure kod V di Craméra i φ; senza dimenticare sporazum između giudicija (Kappa) i uprave dao sam confondenti s korelacijom parziale. Stoga, relacijska algebra fornisce i mattoni concettuali per definee dominio, inversa e composizione, mentre relacijska algebra vodi način na koji arhiviram i istražujem i dajem nei bazu podataka. Glavna ideja je scegliere lo strumento in base al type di variabili, alla forma del legam e agli obiettivi dell'analisi, ricordandoci che nessun coefficiente, da solo, può raccontare tutta la storia.

Povezani članak:
13 vrsta matematičkih funkcija (i njihove karakteristike)