Tipi di mathematical na mga relasyon dahil sa pagkakaiba-iba: teorya, pagsubok at aplikasyon

Huling pag-update: Nobyembre 25, 2025
  • Piliin ang Pearson, Spearman o Kendall batay sa hugis ng laro, normalidad at dimensyon ng campionaria.
  • Ayon sa variabili categoriali usa chi-quadro/Fisher at misura l'associazione con V di Cramér o φ.
  • Valuta confondenti con correlazione parziale at sinusuportahan ang pagsusuri gamit ang mga graphics at diagnosis.
  • Ang algebra ng relasyon (insiemi, funzioni, composizione) ay bumubuo ng pensiero at ang aplikasyon sa database.

relazione tra due variabili

Capire che type di legam c'è tra due variabili è una delle domande più frequenti in statistica applicata, scienza dei dati e ricerca sperimentale at ricerca quantitative . Ang iba pang paraan sa paligid ng relasyon ay linear at palaging bahagi ng cogliere, ang isa pang paraan pabalik ay monotonous ngunit hindi linear, oppure coinvolge category at non numeri, ang anchor ay nakasalalay sa isang ikatlong variabile na confonde le acque: insomma, non è una passeggiata.

Sa praktikal at teoretikal na gabay na ito sa wikang Italyano, makikita natin sa organikong paraan ang pangunahing punto ng mga ugnayang matematikal sa pagitan ng mga baryabol , tulad ng biswal na pag-diagnose at sa pamamagitan ng isang pormal na pagsubok, mga kwalitatibong koepisyenteng ginamit (Pearson, Spearman, Kendall), na may maraming baryabol (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, coefficiente di contingenza, phi), bilang misurare I agree to value gamit ang Kappa, at kung paano pamahalaan ang variability ng kasunduan upang maproseso ang ugnayan sa pagitan ng parziale. Bukod pa rito, apriamo una finestra sull' algebra delle relazioni (sa semisistic at computational sense), mahalaga para sa pagpopormal ng mga konsepto tulad ng domain, composition, inversa at funzioni.

Ano ang nilalayon namin para sa "relazione" dahil sa pagkakaiba-iba

Sa mathematical language, ang isang relasyong R sa pagitan ng A at B ay isang sottoinsieme ng Cartesian prodotto A×B : ang kopyang ordinate (a, b) na maliwanag sa R ​​ay nagpapahiwatig na ang elementong a di A ay “kaugnay” sa elementong b di B. a corresponde esattamente un b, sa secondo nagsilbi kami ng isang tendensya (più o hindi gaanong malakas) at hindi isang legam uno-a-uno.

Ang lahat ng panloob na ugnayang algebra (sa isang insiemikong kahulugan) ay mga kawili-wiling katangian tulad ng riflessività (ogni a è kaugnay ng ugnayang ito), simetriya ((a, b) ay nagpapahiwatig ng (b, a)), antisymmetry (kung ang (a, b) at (b, a) kung gayon ang a = b) at transitività (dahil ang (a, b) at (b, c) ay sumusunod sa (a, w)). Ang katangiang ito ay mahalaga: kung ang isang relasyon ay kumplikado, simetriko at palipat , ipinapakita nito ang isang relasyon ng katumbas na "mga partisyon" A sa classi di elementi equivalenti. Kung ang invece ay riflessive, antisymmetrical at palipat, inaalis natin ang isang relasyon ng pagkakasunod-sunod.

Sa pagsusuring ito, isinasalin namin ang ideyang ito sa pagsasanay: pagsusuri sa uri ng pagkakaiba-iba (quantitative continua, ordinali, nominali/dicotomiche) at la classificazione nalle statistiche e scegliamo strumenti adeguati per misurare la relazione, alam na ang "relazione" ay hindi palaging nangangahulugang "sanhi-effect".

Visual ispezione: kumain ng riconoscere pattern at direksyon

Prima di buttarsi nei numeri, un graphico a dispersione è spesso la demossa più intelligente. Ang isang ulap sa kahabaan ng isang tuwid na linya ay nagmumungkahi ng isang linear na relasyon (positibo o negatibo); istraktura ang kurba na nagpapahiwatig ng mga di-linear na relasyon (ngunit monotone). Kung hindi ka mag-intraved ng isang pattern, maaaring sirain ng linear na relasyon ang pagsang-ayon.

Sa mga variable na halaga, ang scatter plot pannelli (at halimbawa sa R ​​na may mga pares(dati) ) at smussate trend line (geom_smooth sa ggplot2) ay makakatulong upang mapansin ang mga asosasyon, cluster at outlier . Attenzione: gli outlier podeno influenzare moltissimo at coefficienti, specie Pearson.

Halimbawa sa R ​​maaari kang magsimula nang ganito: pairs(dati)

# Matrice di grafici a dispersione
pairs(dati)

# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")

Ang unang visual screening, na itinama gamit ang numero, ay nakakatulong upang masubaybayan ang pagsubok batay sa hugis, monotony, at maliwanag na linearidad.

Suriin ang pagiging normal nito: kapag naghahain ng davvero

Ang parametric test (pati na rin ang Pearson test) ay ipinapalagay, sa ilang mga kaso, normal o may simetriko na istraktura na walang mabigat na code. Per controllare l'ipotesi, si parte spesso da strumenti grafici como istogrammi con densità e QQ-plot.

Sa R, maaaring kasama sa isang minimum na baterya ang:

# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
  hist(x, prob = TRUE)
  lines(density(x), col = "red")
  curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)

Upang ihambing ang mga naobserbahang dami sa isang normal na pamantayan, ang QQ-plot ay hindi institusyonal:

par(mfrow = c(2, 2))
qqfun <- function(x) {
  qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
  qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)

Dahil dito, kung hindi ko magagamit ang pormal na pagsubok ng normalidad para sa pag-iipon ng ebidensya: Kolmogorov–Smirnov na may mga istatistikal na parametro, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–France, Anderson–Darling at ang Pearson (chi-quadro) na pagsubok ng normalidad.

normalita <- function(x) {
  t1 <- ks.test(x, "pnorm", mean(x), sd(x))            # Kolmogorov–Smirnov
  t2 <- nortest::lillie.test(x)                         # Lilliefors
  t3 <- nortest::cvm.test(x)                            # Cramér–von Mises
  t4 <- shapiro.test(x)                                 # Shapiro–Wilk
  t5 <- nortest::sf.test(x)                             # Shapiro–Francia
  t6 <- nortest::ad.test(x)                             # Anderson–Darling
  t7 <- PearsonDS::pearson.test(x)                      # Pearson chi-quadro di normalità
  pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
  data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)

Kung bumalik ako sa normal at ang relasyon ay linear , ang Pearson coefficient ay isang magandang scelta prima; kung hindi, makabubuting piliing paghaluin ang basate sui ranghi sa Spearman o Kendall.

Kaugnay na:  Cross Product: Mga Property, Application, at Exercises

Relasyon sa pagitan ng quantitative variability: covariance at correlation

Ang covariance sa pagitan ng . Ang problema ay ang covariance depende sa mixed unit , na halos hindi maihahambing.

Nilulutas ng Pearson linear correlation ang problema sa standardizing para sa standard deviation: ang coefficient r ay nag-iiba sa pagitan ng -1 at 1, na nagbibigay ng mga halaga mula ±1 na nagpapahiwatig ng isang malakas na linear na relasyon (positibo o negatibo) at 0 na nagmumungkahi ng linearity. Pansin: ang r = 0 ay hindi nagbubukod ng mga non-linear na relasyon.

Pagkalkula bawat ugnayan sa R:

# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")

Kapag ang relasyon ay monotonous ngunit hindi linear o kapag ito ay hindi normal (ang outlier), may kahulugan sa paggamit ng Spearman (ranghi; matatag at inangkop sa medium-large campioni) o Kendall τ (basato su concordanze/discordanze; preferibile su campioni piccoli o con molti pareggi):

# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")

# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")

Isang kapaki-pakinabang na ideya: ang koepisyent para sa pagtukoy ng R² sa isang linear na modelo nang hindi binabago ang variable rate ng Y spiegata nang linear mula sa X. Sa R:

summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared

Para sa dichotomy vs quantitative variability, ang point-biserial coefficient ay tumutugma sa kalkulasyon ng Pearson na may naka-code na baryabol na 0/1; sa pagsasagawa, cor(dichotomous, quantitative) na may method = “pearson”.

Mga variable na kategorya: indipendenza, lakas ng samahan at piccoli campioni

Kapag pumasok ang pagkakaiba-iba ng nominal o ordinal na pagtulog , ang ugnayan ay pinag-aaralan gamit ang isang contingency table (dalas na may klasipikasyon ng doppia). Ang karaniwang ipotesi ay: H0 = indipendenza (kinakailangang kaugnayan), kontrol H1 = dipendenza.

Ang pagsubok sa pagkakaiba ay ang indipendenza chi-framework . Kung ang iyong tulog ay madalas na mas mababa kaysa doon (karaniwan ay < 5), kung gagamitin mo ang Yates correlation para sa 2×2 o pumasa sa Fisher test , partikular na ipinahiwatig sa campioni piccoli.

# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL)  # p-value non significativo => indipendenza plausibile

# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)

Para masukat ang intensidad ng asosasyon sa talahanayan ng I×J kung gagamitin mo ang: V di Cramér (0–1), koepisyent ng contingency (0–1, limitasyon), at sa 2×2 il phi (φ) , na pormal na isang aplikasyon ng Pearson r sa talahanayan ng binary.

# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2)  # riporta V di Cramér, coeff. di contingenza e test

# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale

Kung ang interes ay ang paghahambing ng mga grupo na may mga kwantitatibong baryabol (reddit bawat propesyon), kung ang pagsusulit ay pinahahalagahan , ANOVA at ang alternatibong rispettive na hindi parametric, walang kumpidensyal na agwat. Sa pangkalahatan, ito ay naaayon sa uri ng baryabol at ang pamamaraan ay fondamentale.

Kaugnay na:  Bolzano's Theorem: Explanation, Applications and Exercises

Accordo tra valutatori: Kappa di Cohen

Kapag inuri ng due (ang più) giudici ang gli stessi oggetti sa kategorya, hindi sapat na paghaluin ang porsyento ng kasunduan, perché a quota può essere dovuta sa kasong ito . Sinusukat ng Il Kappa di Cohen ang tamang kasunduan para sa kaswal na kasunduan: Mas pinahahalagahan ko ito sa 0 na nagpapahiwatig ng kasunduan pari al caso, pinahahalagahan ko itong iminumungkahi ng maggiori sa dumaraming kasunduan (interpretazioni comuni: scarso, discreet, moderato, good, molto good).

Sa R posibleng tantyahin ang Kappa anche sa versione ponderata (bawat kategorya ordinali):

set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)

# Kappa non ponderato
fmsb::Kappa.test(val1, val2)

Kung ang kategorya ay hindi naman di-pangkaraniwang natural (at kung minsan, banayad/katamtaman/malala), itinuturing ni Kappa ang parusa bilang "vicini" at "lontani" sa mga hindi pagkakasundo, na nagreresulta sa mas nakapagtuturong resulta.

Relazioni at variabili di confusione: la correlazione parziale

Può capitare che due variabile Sa tanong, kung kalkulahin mo ang ugnayan sa pagitan ng X at Y na kumokontrol para sa Z.

Sa R, na may ggm::pcor si ottiene la correlazione parziale di primo ordine at si può testne la significatività. Kapaki-pakinabang na ihambing ang classical at parziale per capire bilang Z "spiega" del legam grezzo.

library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))

# Correlazione grezza
r  <- cor(dati$GASLAZER, dati$GASAUDE)

# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))

# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)

Kung ang spigot ay "gumulong" sa kontrol, si allora Z ay isang mahalagang katuwang . Kapag ang control variable ay kategorya (hal. professione), hindi ako maaaring gumamit ng mga katulad na pamamaraan o modelo na isinasama ang kategorya bilang isang salik.

Limitahan at mabuting kasanayan sa paggamit ng ugnayan

Ang koepisyent ng Pearson ay naghahalo lamang ng linearity na . Kung ang relasyon ay non-linear (quadratic, sponenziale, logarithmic), maaari itong magresulta sa 0 pur sa pagkakaroon ng isang malakas na dependency. Sa kasong ito, ang mga halaga ng Spearman na , ay binabago ang non-linear na modelo nang naaayon.

Dahil dito , una sa lahat, mainam na suriin ang graph at, kung kinakailangan, magsagawa ng masusing pagsusuri o suriin ang sensitibidad ng resulta kapag inaalis ang mga matinding punto.

Isa pang klasiko: ugnayan ≠ sanhi . Dahil sa pagkakaiba-iba hindi ko maiugnay ang perché sleep influenzate ay nagbibigay ng ikatlong fattore, nagkataon lamang o bawat epekto ng isang kabaligtaran na mekanismo. Servono disegni sperimentali, strumenti causali o modelli appropriati per parlare di causa-effetto.

Uri ng relasyon: linear, monotonous, null, categorial

Madalas itong pinaghalo (quantitative vs dichotomous/nominal/ordinary) kung ito ay nagiging pagsubok ng paghahambing sa pagitan ng mga grupo, correlations biseriali/point-biserial o isang modelo (at halimbawa ng regression na may predictive factori). Gamit ang variabili enterbe categoriali , ci si affida a chi-quadro/Fisher at alle misure di strength dell'associazione già viste.

Ang Funzioni ay kumakain ng mga espesyal na relasyon

Ang isang punsiyon ay isang ugnayang, bawat isang elemento ng dominyo, ay malapit na nag-uugnay sa isang elemento ng kodominasyon. Sa huli, ito ay isang kuwentong A×B na ang bawat a sa A ay naghahambing ng isang sole volta sa unang bahagi. Ang iba pang mahahalagang operasyon sa algebra ng ugnayang ito ay: unyon (R1 ∪ R2), interseksyon (R1 ∩ R2), komposisyon (R2 ∘ R1) at kabaligtaran (R^{-1}, na isang simpleng kopya ng (a, b) sa (b, a)).

Questi mattoni conceptuali tornano utili sia nella matematica pure (katumbas, ordini, classi di equivalenza) sia in applicazioni concrete dove serves formalizzare relazioni fra entità.

Algebra ng relasyon at agham ang ibinigay ko

Sa mundo ng database, ang relatibong algebra ay ang teoretikal na istruktura ng SQL: mga operasyon tulad ng pagpili, pagproseso, pagsali, pagsasama at mga bersyon ng interseksyon ng mga operasyon sa relatibong pag-iintindi. Ang pormalisasyong ito ay isang makapangyarihang sandata para sa mabilis na paglalarawan, pag-optimize, at pagmamanipula ng mga bagay.

Kaugnay na:  Paano itaas ang mga fraction sa mas matataas na termino: mga kapangyarihan at ugat na ginawang simple.

Sa konteksto ng artificial intelligence at machine learning, ang kapasidad ng pagmomodelo ng mga ugnayan sa pagitan ng mga entidad ay nagbibigay-daan para sa cost-effective na pagbuo ng kaalaman, mga sistema para sa rekomendasyon at pipeline para sa integrasyon; ang halagang ito ay balido sa ekonomiks, biostatistics at agham panlipunan, halos palaging ito ay " chi è legato a chi, e in che mode ".

Mga klasikal na halimbawa ng mga relasyon sa teorya ng insiemi

Kaugnayan ng equivalence : makatotohanan, simetriko at transitive na pagtulog. Kabilang sa mga tipikal na ito ang “avere lo stesso valore assoluto” sui reali o la congruenza modulo n sugli interi. Ogni ugnayan ng equivalence induces classi di equivalenza that ripartiscono l'insieme in blocchi disgiunti.

Relazioni d' ordine : riflesive, antisimmetrice at transitive. Esempi: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle part P(X), o “divide” (|) sui naturali. Sono fondamentali per definee ordinamenti totali o parziali and per ragionare su massimi, minimi, catene at antichains.

Order lesicography : ang sinabi ko. Ito ay isang pagkakasunud-sunod sa isang pagkakasunod-sunod (stringhe, numerong nakasulat nang sunod-sunod) na naghahambing ng elemento por elemento; Mayroong isang mahalagang ingay sa istrukturang ito at napapabayaan ko ang mga algorithm.

Ang seksyong ito ay kapaki-pakinabang perché cirda na ang "relazione" sa matematika ay isang pangunahing konsepto ng nag-iisang ugnayan : isama ang uguaglianze, ordini, komposisyon at marami pang iba, lahat ay kailangang-kailangan para sa modellare sistemi complessi.

Praktikal na daloy ng trabaho: kontrolin ito doon sa mga resulta

Posibleng i-flow ang trabaho nang hindi nawawala ito sa konstruksyon at kung minsan:

  • Graphic inspeksyon: scatter plot, smoothing, istogrammi, QQ-plot. Occhio a outlier e forma non lineari.
  • Suriin: kung ito ay gumagana, subukan ang normalidad; Controlli di omoscedasticità kung ang isang linear na modelo ay foreseen.
  • Scelta del coefficiente: Pearson (lineare, dati circa normali), Spearman/Kendall (monotona/non normale/piccoli campioni).
  • Pangkategorya: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Para sa paghahambing ng pangkat, t-test/ANOVA o alternatibo.
  • Confundenti: iugnay ang parziale o multivariate na modelo (kabilang ang kategoryang fattori).

Qualunque sia la scelta, interpretae nel contesto è la chiave: grandezza dell'effetto, significatività statistica, ampiezza del campione at qualità dei dati contano como (se non più) del numero finale.

Esempi di codice R ricorrenti

Sa madaling salita, maaari mong gamitin ang pamamaraang ito upang gawin itong mas tumpak sa pagsusuri ng ugnayan sa pagitan ng mga baryabol, at pagkatapos ay iakma ito sa iyong dataset:

# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")

# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)

# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)

# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab)  # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab)  # V di Cramér e coeff. di contingenza

# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)

# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))

Praktikal na tala : ang pinakamagandang "mahusay" ay ibinibigay mula sa isang petsa. Sulit na patunayan ang hipotesis, ihambing ang pamamaraan at, kapag ito ay gumana, bumuo ng isang iskrip na piccolo para sa mabilis na pag-diagnose ng tanong sa isang maaasahang paraan.

Nakita ni Abbiamo na ang "relazione" ay maaaring mangahulugan nang mas madalas kaysa sa hindi: ang linear na anyo sa Pearson, ang monotony sa Spearman/Kendall, manipis na all'association sa loob ng kategorya na may chi-quadro/Fisher at misure sa V di Cramér at φ; senza dimenticare ang kasunduan sa pagitan ni giudici (Kappa) at ng management na ibinigay ko sa confondenti sa parziale correlation. Samakatuwid, ang relational algebra fornisce i mattoni concettuali sa bawat pagtukoy ng domain, inverse at komposisyon, sa pagitan ng relational algebra ay gumagabay sa mode kung saan ako nag-archive at interroghiamo i dati nei database. Ang ideya ng chiave ay scegliere lo strumento sa base al type di variabili, alla forma del legam at agli obiettivi dell'analisi , ricordandoci che nessun coefficiente, da solo, può raccontare tutta la storia.

Kaugnay na artikulo:
Ang 13 uri ng mathematical function (at ang kanilang mga katangian)