- Pilih Pearson, Spearman atau Kendall berdasarkan bentuk permainan, normaliti dan saiz campionaria.
- Per variabili categoriali usa chi-quadro/Fisher dan misura l'associazione con V di Cramér o φ.
- Valuta confondenti con correlazione parziale dan menyokong analisis dengan grafik dan diagnosis.
- Algebra hubungan (insiemi, funzioni, composizione) menstruktur pensiero dan aplikasi dalam pangkalan data.
Capire che jenis legam c'è tra disebabkan variabili Ia adalah salah satu daripada mereka yang paling kerap mendominasi dalam aplikasi statistik, data daripada data dan ujian eksperimen dan kuantitatif. Sebaliknya perhubungan adalah linear dan sentiasa sebahagian daripada cogliere, cara lain kembali adalah monoton tetapi tidak linear, oppure coinvolge category dan non numeri, sauh bergantung pada variabile ketiga yang confonde le acque: insomma, non è una passeggiata.
Dalam panduan praktikal dan teori dalam bahasa Itali ini, kami membincangkannya dalam mod organik Saya tip utama perhubungan matematik kerana kebolehubahan, cara mendiagnosis secara visual dan dengan ujian formal, pekali kualitatif yang digunakan (Pearson, Spearman, Kendall), cara menukar dengan pembolehubah kategori variabili (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, coefficiente di contingenza, phi), bagaimana misurare l'accordo bekerja dengan Kappa, dan cara menguruskannya variabili di confundimento memproses korelasi parziale. Inoltre, kami akan meningkatkan finestra selatan'algebra delle relazioni (dalam pengertian insiemistik dan pengiraan), essenziale per formalizzare concetti datang domain, komposisi, inversa dan funzioni.
Perkara yang kami maksudkan untuk "relazione" disebabkan oleh kebolehubahan
Dalam bahasa matematik, hubungan antara A dan B ialah ringkasan hasil darab Cartes A×B: ogni coppia ordinata (a, b) appartenente a R menunjukkan bahawa unsur a di A adalah “berkaitan” dengan unsur b di B. Dalam aplikasi termini, hubungan yang bersifat deterministik (fungsi) oppure probabilistica (associazione stochastica): dalam kes pertama ad ogni a corresponde esattamente una b, dalam secondo osserviamo una trend (più atau kurang kuat) dan non un legam uno-a-uno.
Semua 'algebra dalaman perhubungan (dalam erti kata siemistik) adalah proprietà yang menarik datang riflessività (ogni a è berhubung dengan dirinya sendiri), simmetria ((a, b) membayangkan (b, a)), antisimetri (jika (a, b) dan (b, a) allora a = b) dan transitività (dari (a, b) dan (b, c) mengikuti (a, c)). Pemilik hartanah penting ini: jika perhubungan adalah simetri, simetri dan transitif diventa una relazione di equivalenza che “partiziona” A dalam classi di elementi equivalenti. Jika invece adalah riflesif, antisimetri dan transitif, kita abbiamo una relazione d'ordine.
Dalam analisis ini, kami menterjemah idea ini ke dalam amalan: kita menilai jenis kebolehubahan (sambung kuantitatif, ordinali, nominali/dicotomiche) dan di sana pangkat dalam statistik ini dan scegliamo strumenti adeguati per misurare la relazione, mengetahui bahawa "relazione" tidak selalu bermaksud "sebab-akibat".
Ispezione visual: makan corak dan arah riconoscere
Prima di buttarsi nei numeri, un plot berselerak Ia adalah berat perkara yang paling bijak. Awan sepanjang jalan ke bawah garis lurus mencadangkan a hubungan linear (positif atau negatif); struktur keluk indikatif hubungan bukan linear (ma magari monoton). Jika anda tidak memasukkan corak, perhubungan linear mungkin memusnahkan persetujuan.
Dengan sedikit kebolehubahan, saya pannelli di plot serakan (dan contohnya dalam R dengan pasangan(dati)) dan baris yang cenderung smussate (geom_smooth dalam ggplot2) supaya anda boleh ambil perhatian persatuan, kluster dan outlierPerhatian: gli outlier Podeno influenzare moltissimo dan coefficienti, specie Pearson.
Contohnya dalam R si può iniziare così: pasangan(dati)
# Matrice di grafici a dispersione
pairs(dati)
# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")
Saringan visual pertama, betul dengan nombor, Pergi ke scegliere il test giusto berdasarkan bentuk, monotoni dan linearity apparenti.
Semak kenormalannya: semasa menghidangkan davvero
Parametrici ujian Molti (contoh iklan ujian Pearson) Saya andaikan, dalam pelbagai peringkat, normal almeno ialah struktur simetri tanpa kod berat. Untuk mengawal ipotesi, bahagian tertentu struktur grafik datang istogrammi dengan kepadatan e plot QQ.
Dalam R, una bateri minimum potrebbe termasuk:
# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
hist(x, prob = TRUE)
lines(density(x), col = "red")
curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)
Untuk membandingkan pemerhatian kuantitatif dengan piawai biasa, plot QQ è insostituibile:
par(mfrow = c(2, 2))
qqfun <- function(x) {
qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)
Simpan dalam pandangan, jika saya tidak boleh menggunakannya ujian formali di normalità setiap bukti pengumpulan: Kolmogorov–Smirnov dengan anggaran parameter, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–Francia, Anderson–Darling dan ujian di Pearson (chi-quadro) di normal.
normalita <- function(x) {
t1 <- ks.test(x, "pnorm", mean(x), sd(x)) # Kolmogorov–Smirnov
t2 <- nortest::lillie.test(x) # Lilliefors
t3 <- nortest::cvm.test(x) # Cramér–von Mises
t4 <- shapiro.test(x) # Shapiro–Wilk
t5 <- nortest::sf.test(x) # Shapiro–Francia
t6 <- nortest::ad.test(x) # Anderson–Darling
t7 <- PearsonDS::pearson.test(x) # Pearson chi-quadro di normalità
pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)
Jika saya tidur secara normal dan hubungannya adalah linear, pekali Pearson ialah sepupu Celtic yang baik; jika tidak, adalah bijak untuk memilih untuk mencampurkan basate sui ranghi dengan Spearman atau Kendall.
Hubungan antara kebolehubahan kuantitatif: kovarians dan korelasi
La kovarians fra Masalahnya ialah kovarians bergantung dall'unità di misura, quindi è poco setanding.
La Korelasi linear Pearson Selesaikan masalah penyeragaman bagi setiap sisihan piawai: pekali r berbeza antara -1 dan 1, memberikan nilai kepada ±1 ditunjukkan forte relazione lineare (positif atau negatif) dan 0 mencadangkan assenza di linearità. Sila ambil perhatian: r = 0 tidak mengecualikan hubungan bukan linear.
Calcoli setiap korelasi dalam R:
# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")
Quando la relazione è monotona dan bukan linear atau apabila saya tidak tidur secara normal (atau mengandungi yang terpencil), ada gunanya Spearman (ranghi; teguh dan disesuaikan dengan medio-grandi campioni) Kendall τ (basato su concordanze/discordanze; preferibile su juara kecil (atau dengan banyak pareggi):
# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")
# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")
Idea berguna: pekali penentuan R² di un modello lineare semplice memulihkan bahagian pembolehubah Y spiegata secara linear daripada X. Dalam R:
summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared
Per variabili dikotomi vs kuantitatif, pekali titik-biserial bertepatan dengan pengiraan Pearson dengan pembolehubah berkod 0/1; dalam amalan, warna (dikotomi, kuantitatif) kaedah con = "pearson".
Kategori pembolehubah: indipendenza, kekuatan persatuan dan piccoli campioni
Apabila kebolehubahan tidur masuk nominali od ordinali, la relazione si studya con tabelle di contingentza (selalunya dengan klasifikasi doppia). Ipotesis tipikal ialah: H0 = indipendenza (perkaitan yang diperlukan), kawalan H1 = dipendenza.
Il test di riferimento è il chi-quadro di indipendenza. Se ci sono frequenze attese troppo basse (biasanya < 5), jika anda menggunakannya Pembetulan Yates setiap 2×2 o si passa al ujian esatto di Fisher, terutamanya ditunjukkan dengan campioni piccoli.
# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL) # p-value non significativo => indipendenza plausibile
# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)
Setiap quantcare l'intensità dell'associazione dalam tabelle I×J si usano: V di Cramér (0-1), koefisien di kontingenza (0–1, had), dan dalam 2×2 il phi (φ), yang secara rasminya Pearson applicato alla tabella binaria.
# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2) # riporta V di Cramér, coeff. di contingenza e test
# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale
Se l'intersse è confrontore gruppi kebolehubahan kuantitatifnya (es. reddito per professione), jika valutano ujian-t, ANOVA dan alternatif rispettive bukan parametrik, tiada intervalli di confidenza. secara amnya, keselarasan dalam jenis kebolehubahan dan kaedah ia adalah asas.
Accordo tra valutatori: Kappa di Cohen
Apabila due (atau più) giudici mengklasifikasikan no gli stessi oggetti dalam kategori, tidak cukup untuk mencampurkan peratusan persetujuan, perché a quota può essere dovuta al kes. The Kappa di Cohen mengukur perjanjian yang betul untuk perjanjian kasual: Saya menilai lagi hingga 0 menunjukkan perjanjian untuk setiap kes, saya menghargai maggiori suggeriscono persetujuan yang semakin meningkat (interpretazioni comuni: scarso, discreet, moderato, buono, molto buono).
Dalam R è possibile stimare Kappa anche in versione ponderata (setiap kategori ordinali):
set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)
# Kappa non ponderato
fmsb::Kappa.test(val1, val2)
Jika kategori itu bukan susunan semula jadi (ad empio, lieve/moderata/severa), Kappa ponderato penalizza minor dalam perselisihan faham “vicini” dan più quelli “lontani”, menghasilkan spesso più bermaklumat.
Relazioni dan variabili di confusione: la correlazione parziale
Può capitare che due variabili X e Y sembrino molto correlate, but in realtà la strength dell'associazione sia dovuta a una variabile di confundimento Z berkorelasi dengan entrabe. Dalam soalan, jika anda mengklik padanya korelasi separa tra X dan Y mengawal setiap Z.
Dalam R, dengan ggm::pcor si ottiene la correlazione parziale di primo ordine dan si può testne la significatività. Ia berguna untuk membandingkan klasik r e r parziale per capire sebagai Z "spiega" del legam grezzo.
library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))
# Correlazione grezza
r <- cor(dati$GASLAZER, dati$GASAUDE)
# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))
# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)
Jika spiegata kuota "crollas" dopo il controllo, sekarang Z adalah sekutu penting. Apabila pembolehubah kawalan adalah kategori (es. professione), saya tidak boleh menggunakan pendekatan atau model yang serupa yang memasukkan kategori sebagai faktor.
Had dan amalan baik dalam penggunaan korelasi
Campuran pekali Pearson solo la linearità. Jika perhubungan itu bukan linear (kuadrat, sponenziale, logaritma), ia boleh menghasilkan 0 pur dengan adanya pergantungan yang kuat. In questi casi, valutare Spearman, mengubahnya menjadi model bukan linear.
yang outlier Saya tidak boleh memutarbelitkan hasilnya. Atas sebab ini, pertama sekali, adalah mudah untuk menyemak graf dan, jika perlu, menjalankan analisis yang teguh atau menyemak sensitiviti keputusan pada masa yang sama.
Satu lagi klasik: korelasi ≠ sebab akibat. Disebabkan kebolehubahan saya tidak dapat mengaitkan perché sleep influenzate memberikan fattore ketiga, hanya kebetulan atau setiap kesan mekanisme songsang. Servono disegni sperimentali, strumenti causali or modelli appropriati per parlare di causa-effetto.
Jenis hubungan: linear, monotonous, null, kategori
Nei casi misti (kuantitatif vs dichotomica/nominale/ordinata) anda lulus ujian konfrontasi antara gruppi, correlazioni biseriali/point-biserial oa model (regresi contoh iklan dengan faktor ramalan). Dengan kebolehubahan entrarbe categoriali, ci si affida a chi-quadro/Fisher and alle misure di strength dell'associazione già viste.
Funzioni makan hubungan istimewa
yang fungsi Ia adalah perhubungan yang, setiap satu elemen domain, dikaitkan betul-betul unsur daripada kondominium itu. Kesimpulannya, ia adalah kisah sottoinsieme di A×B yang ogni a dalam A membandingkan volta tunggal dengan komponen pertama. Operasi penting lain dalam algebra berkaitan tidur: Kesatuan (R1 ∪ R2), persimpangan (R1 ∩ R2), komposisi (R2 ∘ R1) dan terbalik (R^{-1}, che scambia ciascuna coppia (a, b) dalam (b, a)).
ini mattoni concettuali tornano utili sia nella matematik tulen (setara, ordini, classi di equivalenza) sia in applicazioni konkrit merpati berkhidmat formalizzare hubungan fra entità.
Algebra perhubungan dan sains yang saya berikan
Pangkalan data Nel mondo dei, l'algebra hubungan Ini adalah struktur teori SQL: bagaimana untuk beroperasi pilih, proiezione, join, union dan intersezione sono versioni pratiche di operazioni su relazioni-insiemi. Pemformalisasi ini merupakan senjata ampuh untuk menerangkan, mengoptimumkan dan memanipulasi sesuatu dengan cepat.
Di padang kecerdasan buatan dan pembelajaran mesin, kapasiti perhubungan model untuk membolehkan pembinaan graf conoscense, sistem raccomandation dan saluran paip integrasi; Nilai ini sah dalam ekonomi, biostatistik dan sains sosial, ia hampir selalu "chi ialah legato a chi, dan dalam mod che".
Contoh klasik perhubungan dalam teori insiemi
Relazioni di equivalenza: tidur senapang, simetri dan transitif. Contoh termasuk "mempunyai nilai ini sebagai penyelesaian" adalah benar-benar nyata atau ada modulo kongruen n Saya mencadangkan secara dalaman. Ogni hubungan kesetaraan mendorong classi di equivalenza che ripartiscono l'insieme in blocchi disgiunti.
Relazioni d'pesanan: senapang, antisimetri dan transitif. Jenis: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle parti P(X), o “bahagi” (|) sui naturali. Tidur Fondamentali mengikut definisi ordinamenti totali o parziali dan setiap rantau ialah massimi, minimi, katena dan antirantainya.
Biasa lesikografik: itu yang saya katakan. Ia adalah susunan dalam urutan (rentetan, nombor yang ditulis dalam urutan) yang membandingkan unsur demi unsur; Terdapat bunyi penting dalam struktur ini dan saya mengabaikan algoritma.
Bahagian ini berguna untuk memahami bahawa "relazione" dalam matematik ialah satu konsep più ampio della sole correlazione: termasuk uguaglianze, ordini, gubahan dan banyak lagi, semuanya amat diperlukan untuk sistem modellare complessi.
Aliran kerja praktikal: kawal di sana hasil
A mungkin flusso di lavoro jadi anda tidak kehilangannya jika anda memainkan dan di mana:
- Pemeriksaan grafik: plot taburan, pelicinan, istogrammi, plot QQ. Occhio a outlier e forma non lineari.
- Semak: jika ia berfungsi, uji kenormalan; Controlli di omoscedasticità jika model linear diramalkan.
- Scelta del coefficiente: Pearson (lineare, dati circa normali), Spearman/Kendall (monotona/non normale/piccoli campioni).
- kategori: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Untuk perbandingan kumpulan, ujian-t/ANOVA atau alternatif.
- Confundenti: menghubungkaitkan model parziale atau multivariate (termasuk kategori fattori).
Qualunque sia la scelta, interpretae nel contexto Ia adalah chiave: grandezza dell'effetto, statistik penting, ampiezza del campione e qualità dei dati contano como (jika tidak più) del numero finale.
Esempi di codice R ricorrenti
Riassumendo alcune chiamate utili yang menjadikannya lebih tepat dalam menganalisis hubungan antara pembolehubah, dan yang boleh disesuaikan dengan set data anda:
# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")
# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)
# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)
# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab) # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab) # V di Cramér e coeff. di contingenza
# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)
# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))
Nota praktikal: le scelte “giuste” dipendono dai dati. Adalah berbaloi untuk mengesahkan hipotesis, membandingkan kaedah dan, apabila ia berfungsi, membina skrip piccolo untuk mendiagnosis soalan dengan cepat dengan cara yang boleh dipercayai.
Abbiamo melihat bahawa "relazione" boleh bermakna lebih kerap daripada tidak: bentuk linear dengan Pearson, monotoni dengan Spearman/Kendall, all'asosiasi nipis dalam kategori dengan chi-quadro/Fisher dan misure dengan V di Cramér dan φ; senza dimenticare perjanjian antara giudici (Kappa) dan pengurusan yang saya berikan konkondenti dengan korelasi parziale. Oleh itu, algebra relasi fornisce i mattoni concettuali per definee dominio, inversa and composizione, mentre algebra relational membimbing mod di mana saya mengarkib dan menginterogasi pangkalan data dati nei. Idea chiave adalah scegliere lo strumento in base al type di variabili, alla forma del legam and agli obiettivi dell'analisi, ricordandoci che nessun coefficiente, da solo, può raccontare tutta la storia.