- Vali Pearson, Spearman või Kendall mängu vormi, normaalsuse ja meistrivõistluste suuruse põhjal.
- Per variabili categoriali usa chi-quadro/Fisher e misura l'associazione con V di Cramér o φ.
- Valuta confondenti con correlazione parziale ning toetab analüüsi graafika ja diagnoosiga.
- Seosalgebra (insiemi, funzioni, composizione) struktureerib andmebaasis pensiero ja rakenduse.
Capire che tüüpi legam c'è tra due variabili See on üks neist, mis domineerib kõige sagedamini statistilistes rakendustes, andmetest saadud andmetes ja eksperimentaalsetes testides ning kvantitatiivneVastupidi on seos lineaarne ja alati osa mõistusest, teine tee tagasi on monotoonne, kuid mittelineaarne, vastassuunas kaasatud kategooria ja mitte numbrite korral sõltub ankur kolmandast muutujast, mis seob end: unsomma, non è una passeggiata.
Selles itaaliakeelses praktilises ja teoreetilises juhendis arutame seda orgaanilises vormis Matemaatiliste seoste peamine nipp varieeruvuse tõttu, kuidas visuaalselt ja formaalse testiga diagnoosida, kasutatud kvalitatiivseid koefitsiente (Pearson, Spearman, Kendall), kuidas muuta variabili kategooriliste muutujatega (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, coefficiente di contingenza, phi), kuidas akordi rikkuma Kappaga töötamine ja selle haldamine segaduse muutjad töötle parziale korrelatsiooni. Lisaks parandame lõunaosariikide finestrat.suhete algebra (insiemistlikus ja arvutuslikus mõttes), essenziale per formalizzare concetti tulevad domeeni, kompositsiooni, inversa ja funzioni.
Mida me muutlikkuse tõttu „suhtena” silmas peame
Matemaatilises keeles on A ja B vaheline seos järgmine: Cartesiuse korrutise A×B kokkuvõte: ogni coppia ordinata (a, b) appartenente a R näitab, et element a di A on "seoses" elemendiga b di B. In termini applicati, deterministlik seos (funktsioon) oppure probabilistica (associazione stochastica): esimesel juhul ad ogni a relevante esattamente una b, teisel juhul osserviamo una trend (più või vähem tugev) ja non un legam uno-a-uno.
Kõik seoste sisealgebrad (siemistlikus mõttes) on huvitavad kui need, mis on oma olemuselt sarnased. vintpüsside (ogni a è enda suhtes), sümmeetria ((a, b) viitab (b, a)-le), antisümmeetria (kui (a, b) ja (b, a) siis a = b) ja transitiivsus (punktidest (a, b) ja (b, c) järgneb (a, c)). See oluline kinnisvaraomanik: kui seos on sümmeetriline, siis sümmeetriline ja transitiivne diventa una võrdväärne suhe che "partiziona" A in classi di elementi ekvivalenti. Kui invece on vintpüssiv, antisümmeetriline ja transitiivne, siis me abbiamo una korralduslik suhe.
Selles analüüsis rakendame seda ideed praktikas: Me hindame varieeruvuse tüüpi (kvantitatiivne jätka, ordinali, nominali/dicotomiche) ja seal koht selles statistikas ja scegliamo strumenti adeguati per misurare la relazione, teades, et "relazione" ei tähenda alati "põhjus-tagajärg".
Visual ispezione: söö riconoscere mustrit ja suunda
Prima di buttarsi nei numeri, un hajuvusdiagramm See on kõige intelligentsema asja kaal. Pilv sirgjooneliselt viitab millelegi, lineaarne seos (positiivne või negatiivne); struktureerige indikatiivne kõver mittelineaarsed seosed (ma magari monotoonne). Kui sa mustrit ei sisesta, võib lineaarne seos nõusoleku hävitada.
Väikese varieeruvusega on I pannelli di hajuvusdiagramm (ja näiteks R-is koos paarid(andmed)) ja joon, mis kipub smussate'i minema (geom_smooth ggplot2-s), et saaksite märkida ühendused, klaster ja erandidTähelepanu: gli-erinevus Podeno influenzare moltissimo i coefficienti, liik Pearson.
Näiteks keeles R si può iniziare così: paarid(andmed)
# Matrice di grafici a dispersione
pairs(dati)
# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")
Esimene visuaalne kontroll, numbrile vastav, Avage scegliere il test giusto vormi, monotoonsuse ja näilise lineaarsuse põhjal.
Kontrollige selle normaalsust: davvero serveerimisel
Molti parameetrilised testid (Pearson'i testi näide) eeldan, et erineval määral normaalsus Almeno on sümmeetriline struktuur ilma raske koodita. Ipotesi juhtimiseks tuleb graafilise struktuuri konkreetne osa tihedusega isogrammid e QQ-graafik.
R-is, una minimaalne aku potrebbe hulka kuuluvad:
# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
hist(x, prob = TRUE)
lines(density(x), col = "red")
curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)
Kvantitatiivsete vaatluste võrdlemiseks normaalse standardi omadega, QQ-graafik asendamatu:
par(mfrow = c(2, 2))
qqfun <- function(x) {
qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)
Hoia seda silmapiiril, kui ma seda kasutada ei saa normaalsuse ametlik test tõendite kogumise kohta: Kolmogorov–Smirnov parameetrite hinnangutega, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–Francia, Anderson–Darling ja Pearsoni (chi-quadro) di normalità test.
normalita <- function(x) {
t1 <- ks.test(x, "pnorm", mean(x), sd(x)) # Kolmogorov–Smirnov
t2 <- nortest::lillie.test(x) # Lilliefors
t3 <- nortest::cvm.test(x) # Cramér–von Mises
t4 <- shapiro.test(x) # Shapiro–Wilk
t5 <- nortest::sf.test(x) # Shapiro–Francia
t6 <- nortest::ad.test(x) # Anderson–Darling
t7 <- PearsonDS::pearson.test(x) # Pearson chi-quadro di normalità
pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)
Kui ma magan normaalselt ja suhe on lineaarne, Pearsoni koefitsient on hea keldi nõbu; vastasel juhul on mõistlik eelistada basate sui ranghi segamist Spearmani või Kendalliga.
Kvantitatiivse varieeruvuse seos: kovariatsioon ja korrelatsioon
La kovariatsioon Probleem on kovariatsioonis misura üksuselt sõltuv, see on natuke võrreldav.
La Pearsoni lineaarne korrelatsioon Lahendage standardhälbe järgi standardiseerimise probleem: koefitsient r varieerub vahemikus -1 kuni 1, andes väärtuseks ±1, mis on näidatud lineaarse suhte tugev (positiivne või negatiivne) ja 0 viitab assenza di linearità. Pange tähele: r = 0 ei välista mittelineaarseid seoseid.
Korrelatsioonikalkulatsioonid R-is:
# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")
Kui on suhe monotonne ja mittelineaarne või kui ma ei maga normaalselt (või hoian kõrvalekaldeid kontrolli all), on mõtet seda kasutada Spearman (ranghi; vastupidav ja kohandatud keskmise-grandi campioni jaoks) Kendall τ (basato su concordanze/discordanze; eelistatavalt su väikesed meistrid (või paljude pareggidega):
# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")
# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")
Kasulik idee: määramiskoefitsient R² di un lihtne lineaarne mudel taastab Y spiegata muutuja osakaalu lineaarselt X-ist. R-is:
summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared
Muutuja kohta dihhotoomia vs kvantitatiivne, koefitsient punkt-biseriaalne langeb kokku Pearsoni arvutusega kodeeritud muutujaga 0/1; praktikas värv (dikotoomne, kvantitatiivne) con meetod = „pearson”.
Muutuvad kategooriad: indipendenza, assotsiatsiooni tugevus ja piccoli campioni
Kui une varieeruvus ilmneb nominaalsed või ordinaalsed, stuudiokorteri puhkus rühmade tabelid (sageli doppia klassifikatsiooniga). Tüüpiline ipotesi on: H0 = indipendenza (vajalik seos), kontroll H1 = dipendenza.
Mõõtmiskatse on see. iseseisev nelinurkSee on minu oma sagedusala troppo basse (tavaliselt < 5), kui te seda kasutate Yatesi parandus 2 × 2 tk kohta Fisheri test, eriti soovitatav koos campioni piccoli'ga.
# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL) # p-value non significativo => indipendenza plausibile
# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)
Kvantcare'i kohta l'intensità dell'associazione tabelis I×J, kui seda kasutatakse: V di Cramér (0 – 1), tingimuslikkuse koefitsiendid (0–1, piirang) ja 2×2 il-s phi (φ), mis on ametlikult Pearsoni applicato alla tabella binaria.
# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2) # riporta V di Cramér, coeff. di contingenza e test
# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale
Kui vahekord on vastamisi gruppi selle kvantitatiivne varieeruvus (es. reddito per professione), kui valutano t-test, ANOVA e le ripettive alternatiiv nonparametriche, no intervalli di confidenza. Üldiselt varieeruvuse tüübi ja meetodi sidusus on aluspõhjalik.
Acccordo tra valutatori: Kappa di Cohen
Kui due (või più) giudici liigitab no gli stessi oggetti kategooriasse, ei piisa nõustumisprotsendi segamisest, perché a quota può essere dovuta al juhul. Kappa di Cohen kvantifitseerib juhusliku kokkuleppe õiget kokkulepet: ma hindasin iga juhtumi puhul kokkuleppele viitavat väärtust 0-ni, ma hindasin maggiori suggeriscono kasvav kokkulepe (interpretazioni comuni: scarso, diskreetne, moderato, buono, molto buono).
In R è possibile stimare Kappa anche in versioon ponderata (tavakategooriate kaupa):
set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)
# Kappa non ponderato
fmsb::Kappa.test(val1, val2)
Kui kategooria ei ole loomulik järjestus (ad empio, lieve/moderata/severa), Kappa ponderato penalizza minor lahkarvamusel “vicini” ja più quelli “lontani”, mille tulemuseks on spesso più informatiivne.
Relazioni e variabili di confusione: la correlazione parziale
Può capitare che due variabili X e Y sembrino molto korreleeruvad, kuid in realtà la tugevus dell'associazione sia dovuta a una segaduse muutuja Z seotud entrabe'iga. Küsimus on selles, kas te sellel klõpsate? osaline korrelatsioon X ja Y juhtimine Z järgi.
In R, koos ggm::pcor si ottiene la correlazione parziale di primo ordine e si può testne la significatività. Kasulik on võrrelda klassikaline r e r parziale per capire kui Z “spiega” del legam grezzo.
library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))
# Correlazione grezza
r <- cor(dati$GASLAZER, dati$GASAUDE)
# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))
# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)
Kui spiegata kvoot "crollas" dopo il controllo, nüüd Z oli oluline konföderatsiooni liigeKui kontrollmuutuja on kategooria (nt professione), ei saa ma kasutada sarnaseid lähenemisviise või mudeleid, mis hõlmavad kategooriat tegurina.
Korrelatsiooni kasutamise piirang ja hea tava
Pearsoni koefitsiendi segu ainult lineaarsusKui seos on mittelineaarne (ruut-, spontaansus-, logaritmiline), võib see tugeva sõltuvuse korral anda tulemuseks 0. Sellisel juhul tuleks väärtusi määrata. Spearman, muutes selle mittelineaarseks mudeliks.
Gli väljapoole Ma ei saa tulemust moonutada. Sel põhjusel on esiteks mugav graafikut kontrollida ja vajadusel teha robustne analüüs või samal ajal tulemuste tundlikkust kontrollida.
Teine klassika: korrelatsioon ≠ põhjuslikkus. Muutuvuse tõttu ei saa ma korreleerida perché une influenzaat annab kolmanda fattore, lihtsalt kokkusattumus või pöördmehhanismi mõju. Servono disegni sperimentali, strumenti causali o modelli appropriati per parlare di causa-effetto.
Seose tüüp: lineaarne, monotoonne, null, kategooriline
Nei casi misti (kvantitatiivne vs dichotomica/nominale/ordinata) se läbib gruppide, correlazioni biseriali/point-biserial oa vastasseisu testi modelli (näide regressioonist ennustatud teguritega). Muutlikkusega kategooriline sissepääs, ci si affida a chi-quadro/Fisher e all misure di force dell'associazione già viste.
Funzioni sööb erilisi suhteid
A. funktsioon See on suhe, mis domeeni ühe elemendi kohta seostub täpselt üks element korteriomandist. Kokkuvõtteks võib öelda, et see on A×B-tüüpi lugu, mis ogni a-s A võrdleb ainsa volta esimese komponendiga. Muud olulised tehted unega seotud algebras: liit (R1 ∪ R2), ristmik (R1 ∩ R2), koostis (R2 ∘ R1) ja tagurpidi (R^{-1}, che scambia ciascuna coppia (a, b) punktis (b, a)).
questi kontseptuaalsed mattoni tornano utili sia nella puhas matemaatika (equivalenze, ordini, classi di equivalenza) sia in applicazioni betoontuvi teenib formalizzare suhteid fra entità.
Andsin seoste ja loodusteaduste algebra
Maailmas, kus on andmebaasrelatsioonialgebra See on SQL-i teoreetiline struktuur: kuidas seda kasutada vali, proiezione, liitu, liit ja intersezione sono versioni pratiche di operazioni su relazioni-insiemi. See vormistamine on võimas relv asjade kiireks kirjeldamiseks, optimeerimiseks ja manipuleerimiseks.
Kontekstis tehisintellekt ja masinõpe, seoste modelleerimise võime võimaldada konossentsigraafikute, järjestussüsteemide ja integreerimise torujuhtmete konstrueerimist; See väärtus kehtib majandusteaduses, biostatistikas ja sotsiaalteadustes, see on peaaegu alati „chi on legato chi ja che režiimis".
Klassikalised näited seostest insiemi teoorias
Suhted samaväärsust: uni riflessiivne, sümmeetriline ja transitiivne. Näited nagu „omama seda väärtust lahendusena“ on tõesti reaalsed või olemas kongruentsus moodul n Pakkusin sisemiselt välja. Ogni ekvivalentsussuhe kutsub esile samaväärsusklassid che ripartiscono l'insieme in blocchi disgiunti.
Suhtedordineerima: vintpüssiv, antisimmeetriline ja transitiivne. Esempi: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle parti P(X), o „jagama” (|) sui naturali. Fundamentaalne uni määratluse järgi täielikult või osaliselt ja piirkonna kohta on selle massimi, minimi, kateen ja antiketid.
järjekord lessikograafiline: just seda ma ütlesingi. See on järjekord järjestuses (string, järjestusse kirjutatud number), mis võrdleb element elemendi haaval; Selles struktuuris on oluline müra ja ma jätan algoritmid tähelepanuta.
See osa on kasulik mõistmaks, et „relazione” on matemaatikas mõiste più ampio della sole correlazione: sisaldavad uguaglianze'i, ordini, koostist ja palju muud, kõik on modellare süsteemi komplesside jaoks hädavajalikud.
Praktiline töövoog: kontrolli oma tulemusi
Võimalik töövoolik nii et sa ei kaota seda, kui sa instrumenteerid ja kus:
- Graafiline kontroll: hajusdiagramm, silumine, istogrammi, QQ-diagramm. Occhio a outlier e forma non lineari.
- TšekidKui see toimib, testida normaalsust; Kui ette nähakse lineaarset mudelit, siis kontrollida omaskedastiivsust.
- Koefitsiendi skoor: Pearson (lineaarne, normaalsed andmed), Spearman/Kendall (monotoonne/non normale/piccoli campioni).
- Kategooriline: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Rühmade võrdlemiseks t-test/ANOVA või alternatiiv.
- Confundenti: korreleerida parziale või mitme muutujaga mudel (sh kategooria fattori).
Qualunque sia la scelta, kontekstis tõlgendama See on chiave: grandezza dell'effetto, märkimisväärne statistika, ampiezza del campione e qualità dei dati contano como (kui mitte più) del numero finale.
R-koodi lugemise näited
Riassumendo alcune chiamate utili mis muudab muutujate vahelise seose analüüsimise täpsemaks ja mida saab teie andmestikule kohandada:
# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")
# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)
# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)
# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab) # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab) # V di Cramér e coeff. di contingenza
# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)
# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))
Praktiline märkus: andmetest sõltuvad „suuremad“ killud. Hüpoteesi valideerimine, meetodi võrdlemine ja kui see toimib, pikolo-skripti koostamine tasub ära, et küsimust kiiresti ja usaldusväärselt diagnoosida.
Abbiamo nägi, et "relazione" võib sagedamini tähendada: lineaarset vormi Pearsoniga, monotoonsust Spearmani/Kendalliga, õhukest seost kategooria piires chi-quadro/Fisheriga ja valelikkust V di Craméri ja φ-ga; senza dimenticare kokkulepe giudici (Kappa) ja juhtkonna vahel. Andsin confondenti parziale korrelatsiooniga. Seetõttu juhib relatsioonialgebra fornisce i mattoni concettuali per definee domininio, inversa e composizione, mentre relatsioonialgebra režiimi, milles ma arhiveerin ja interroghiamo i dati nei andmebaasi. Chiave idee on scegliere lo strumento in base al type di variabili, alla forma del legam e agli obiettivi dell'analisi, ricordandoci che nessun coefficiente, da solo, può raccontare tutta la storia.