Tipy matematických vztahů v důsledku variability: teorie, testování a aplikace

Poslední aktualizace: Listopadu 25, 2025
  • Vyberte si Pearsona, Spearmana nebo Kendalla na základě formy hry, normálnosti a velikosti šampionátu.
  • Podle různých kategorií usa chi-quadro/Fisher e misura l'associazione con V di Cramér o φ.
  • Valuta concondenti con correlazione parziale a podporuje analýzu pomocí grafiky a diagnózy.
  • Vztahová algebra (insiemi, funzioni, composizione) strukturuje pensiero a aplikaci v databázi.

vztah mezi proměnnými

Capire che typ legam c'è tra due variabili Je to jeden z nich, který nejčastěji dominuje ve statistických aplikacích, datech z dat a experimentálních testů a kvantitativníOpačný vztah je lineární a vždy součástí koglière, další cesta zpět je monotónní, ale nelineární, naproti tomu koinvolge category a non-numeri, kotva závisí na třetí proměnné, která spočívá v příčině: nepořádek, nechodec.

V tomto praktickém a teoretickém průvodci v italštině se o tom budeme bavit v organickém režimu. Hlavní tip matematických vztahů kvůli variabilitě, jak vizuálně diagnostikovat a pomocí formálního testu, použité kvalitativní koeficienty (Pearson, Spearman, Kendall), jak se měnit s variabili kategorickými proměnnými (chi-quadro di indipendenza, test esatto di Fisher, V di Cramér, koeficient di contingenza, phi), jak zmírnit dohodu práce s Kappou a jak ji zvládat proměnné zmatku zpracovat korelaci Parziale. Inoltre, vylepšíme jižní finestrualgebra vztahů (v insiemistickém a výpočetním smyslu), essenziale per formalizzare concetti come domain, composition, inversa a funzioni.

Co zamýšlíme jako „relazione“ kvůli variabilitě

V matematickém jazyce je vztah mezi A a B shrnutí kartézského součinu A×B: ogni coppia ordinata (a, b) appartenente a R označuje, že prvek a di A je „ve vztahu“ s prvkem b di B. In termini applicati, vztah, který je deterministický (funkce) oppure probabilistica (associazione stochastica): v prvním případě ad ogni a koresponde esattamente una b, v druhém osserviamo una trend (più nebo méně silné) a non un legam uno-a-uno.

Veškerá „vnitřní algebra vztahů (v siemistickém smyslu) je zajímavá proprietà come“ riflessività (ogni a è ve vztahu k sobě samému), symetrie ((a, b) implikuje (b, a)), antisymetrie (pokud (a, b) a (b, a) nebo a = b) a tranzitivita (z (a, b) a (b, c) vyplývá (a, c)). Tento klíčový vlastník nemovitosti: Pokud je vztah symetrický, symetrický a tranzitivní diventa una relace ekvivalence che „partiziona“ A in classi di elementi ekvivalenti. Pokud je invece riflessivní, antisymetrická a tranzitivní, my abbiamo una relacione d'ordine.

V této analýze tuto myšlenku převádíme do praxe: vyhodnocujeme typ variability (kvantitativní pokračování, ordinali, nominali/dicotomiche) a tam umístění v této statistice a scegliamo strumenti adeguati per misurare la relazione s vědomím, že „relazione“ neznamená vždy „příčina-následek“.

Vizuální ispezione: jíst riconoscere vzor a směr

Prima di buttarsi nei numeri, un bodový graf Je to tíha té nejinteligentnější věci. Mrak táhnoucí se celou délkou přímé čáry naznačuje... lineární vztah (kladné nebo záporné); strukturovat indikativní křivku nelineární vztahy (ma magari monotónní). Pokud neprovedete intravední vzorec, lineární vztah může zničit souhlas.

S malou variabilitou jsem použil bodový graf (a například v R s páry (data)) a čára, která má tendenci se zplošťovat (geom_smooth v ggplot2), takže si můžete všimnout asociace, shluky a odlehlé hodnotyPozor: gli odlehlá hodnota Poděná influenzare moltissimo i koeficient, druh Pearson.

Například v R si può iniziare così: páry (data)

# Matrice di grafici a dispersione
pairs(dati)

# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")

První vizuální prohlídka, s přesností na daný počet, Přejít na scegliere il test giusto založené na formě, monotónnosti a zdánlivé linearitě.

Zkontrolujte jeho normálnost: při podávání davvero

Parametrický Moltiho test (například Pearsonova testu) předpokládám v různé míře, normálnost Almeno je symetrická struktura bez náročného kódu. Pro řízení hypotézy je použita specifická část grafické struktury. zkratky s hustotou e QQ-graf.

V R, una minimální kapacita baterie potřebné zahrnuje:

# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
  hist(x, prob = TRUE)
  lines(density(x), col = "red")
  curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)

Pro porovnání kvantitativních pozorování s pozorováními běžného standardu, QQ-graf jsou nezastupitelné:

par(mfrow = c(2, 2))
qqfun <- function(x) {
  qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
  qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)

Měj to na očích, když to nemůžu použít formální test normálnosti podle akumulačních důkazů: Kolmogorov–Smirnov s odhady parametrů, Lilliefors, Cramér–von Mises, Shapiro–Wilk, Shapiro–Francia, Anderson–Darling e il test di Pearson (chi-quadro) di normalità.

normalita <- function(x) {
  t1 <- ks.test(x, "pnorm", mean(x), sd(x))            # Kolmogorov–Smirnov
  t2 <- nortest::lillie.test(x)                         # Lilliefors
  t3 <- nortest::cvm.test(x)                            # Cramér–von Mises
  t4 <- shapiro.test(x)                                 # Shapiro–Wilk
  t5 <- nortest::sf.test(x)                             # Shapiro–Francia
  t6 <- nortest::ad.test(x)                             # Anderson–Darling
  t7 <- PearsonDS::pearson.test(x)                      # Pearson chi-quadro di normalità
  pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
  data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)

Pokud spím zhruba normálně a vztah je lineárníPearsonův koeficient je dobrým keltským bratrancem; jinak je rozumné dát přednost smíchání basate sui ranghi se Spearmanem nebo Kendallem.

Související články:  Hypergeometrické rozdělení: vzorce, rovnice, model

Vztah mezi kvantitativní variabilitou: kovariancí a korelací

La kovariance Problém je v kovarianci závislé na jednotce misy, pak je to trochu srovnatelné.

La Pearsonova lineární korelace Vyřešte problém standardizace na směrodatnou odchylku: koeficient r se pohybuje mezi -1 a 1, což dává hodnotu ±1. silná lineární relace (pozitivní nebo negativní) a 0 naznačuje assenza di linearità. Poznámka: r = 0 nevylučuje nelineární vztahy.

Výpočty pro korelace v R:

# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")

Kdy je vztah monotónní, ale nelineární nebo když normálně nespím (nebo neobsahuji odlehlou hodnotu), má smysl používat Spearman (ranghi; robustní a přizpůsobené pro medio-grandi campioni) Kendall τ (basato su concordanze/discordanze; preferibile su malí šampioni (nebo s mnoha páry):

# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")

# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")

Užitečná myšlenka: koeficient determinace R² z jednoho jednoduchý lineární model lineárně obnovuje variabilní podíl Y spiegata z X. V R:

summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared

Dichotomie per variabili vs. kvantitativní, koeficient bodový biseriál shoduje se s Pearsonovým výpočtem s kódovanou proměnnou 0/1; v praxi barva (dichotomická, kvantitativní) metoda con = „pearson“.

Kategorie proměnných: indipendenza, síla asociace a piccoli campioni

Když se objeví variabilita spánku nominální nebo ordinální čísla, vztah, pokud studium s tabulka kontingencí (často s klasifikací doppia). Typická ipotesi je: H0 = indipendenza (nutná asociace), kontrola H1 = dipendenza.

Zkouška náboje je jeho chí-kvadra nezávislostiJsi to ty často útočí troppo basse (obvykle < 5), pokud jej používáte Yatesova oprava na 2×2 nebo pro průchod Fisherův testovací esatto, zvláště vhodné s campioni piccoli.

# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL)  # p-value non significativo => indipendenza plausibile

# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)

Na kvantitativní péči l'intensità dell'associazione v tabulce I×J se používá: V di Cramér (0 – 1), koeficienty kontingence (0–1, omezení) a v 2×2 il fí (φ), což je formálně Pearson applicato alla tabella binaria.

# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2)  # riporta V di Cramér, coeff. di contingenza e test

# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale

Se l'intersse je konfrontováno skupiny, její kvantitativní variabilita (es. reddito per professione), je-li valutano t-test, ANOVA e le rispettive alternative non parametriche, no intervalli di confidenza. Obecně, koherence v typu variability a metodě je kritický.

Související články:  Otevřená věda: data, volný přístup a síťová společnost.

Accordo tra valutatori: Kappa di Cohen

Když náležité (nebo più) giudici zařadí no gli stessi oggetti do kategorie, nestačí smíchat procento shody, perché a kvóta può essere dovuta al případ, to Kappa di Cohen kvantifikuje správnou shodu pro nezávaznou shodu: Hodnotil jsem dále na 0, což označuje shodu pro každý případ, hodnotil jsem maggiori suggeriscono rostoucí shoda (interpretazioni comuni: scarso, diskrétní, moderato, buono, molto buono).

V R è possibile stimare Kappa anche in počítáno (podle pořadových kategorií):

set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)

# Kappa non ponderato
fmsb::Kappa.test(val1, val2)

Pokud kategorie není přirozeným řádem (ad empio, lieve/moderata/severa), Kappa ponderato penalizza minor v nesouhlasu „vicini“ a più quelli „lontani“, což má za následek spesso più informativní.

Relazioni e variabili di confusione: la correlazione parziale

Può capitare che due variabili X e Y sembrino molto korelát, ale v realtà la force dell'associazione sia dovuta a una proměnná zmatku Z souvisí s entrabe. Pokud na něj kliknete, částečná korelace Řízení os X a Y podle osy Z.

V R, s ggm::pcor si ottiene la correlazione parziale di primo ordine e si può testne la significatività. Je užitečné porovnávat klasické r e r parziale na capire jako Z „spiega“ del legam grezzo.

library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))

# Correlazione grezza
r  <- cor(dati$GASLAZER, dati$GASAUDE)

# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))

# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)

Pokud kvóta spiegata „crollas“ dopo il controllo, nyní Z byl důležitým společníkemPokud je řídicí proměnnou kategorie (např. profese), nemohu použít podobné přístupy nebo modely, které zahrnují kategorii jako faktor.

Limit a osvědčené postupy při používání korelace

Směs Pearsonových koeficientů pouze linearitaPokud je vztah nelineární (kvadratický, sponeční, logaritmický), může při silné závislosti vést k 0 bodům. V daném případě ohodnoťte. Spearman, čímž se transformuje do nelineárního modelu.

Gli outlier Nemohu zkreslit výsledek. Z tohoto důvodu je v první řadě vhodné zkontrolovat graf a v případě potřeby provést robustní analýzu nebo zároveň zkontrolovat citlivost výsledků.

Další klasika: korelace ≠ kauzalita. Vzhledem k variabilitě nemohu korelovat perché spánek influenzate dává třetí fattore, pouze náhoda nebo na účinek inverzního mechanismu. Servono disegni sperimentali, strumenti causali o modelli accurati per parlare di causa-effetto.

Typ vztahu: lineární, monotónní, nulový, kategoriální

Nei casi misti (kvantitativní vs dichotomica/nominale/ordinata) projde testem di konfrontace mezi gruppi, correlazioni biseriali/point-biserial oa modely (příklad regrese s predikovaným faktorem). S variabilitou kategorizace, ci si affida a chi-quadro/Fisher e alle misure di force dell'associazione già viste.

Funzioni jedí speciální vztahy

A funkce Je to vztah, který pro každý prvek domény asociuje přesně jeden prvek bytu. Závěrem lze říci, že je to spottoinsieme di A×B příběh, který ogni a v A porovnává jediný volta s první složkou. Další důležité operace v algebře související se spánkem: svaz (R1 ∪ R2), průsečík (R1 ∩ R2), composizione (R2 ∘ R1) a zvrátit (R^{-1}, che scambia ciascuna coppia (a, b) v (b, a)).

questi mattoni konceptuální tornádo využitelné v ní čistá matematika (ekvivalenze, ordini, classi di equivalenza) sia in applicazioni betonová holubice slouží formalizzare vztahy fra entità.

Dal jsem algebru vztahů a vědu

Ve světě databází, l'relační algebra Toto je teoretická struktura SQL: jak s ním pracovat select, proiezione, join, unione a intersezione sono versioni pratiche di operazioni su relazioni-insiemi. Tato formalizace je mocnou zbraní pro rychlé popisování, optimalizaci a manipulaci s věcmi.

Související články:  O kolik více je 7/9 krát 2/5?

V poli umělá inteligence a strojové učení, schopnost modelování vztahů umožnit konstrukci grafů konoscence, systémů doporučování a integračního kanálu; Tato hodnota je platná v ekonomii, biostatistice a sociálních vědách, je téměř vždy „chi je legato a chi a v režimu che".

Klasické příklady vztahů v teorii insiemiho

Vztahy ekvivalence: riflesivní, symetrický a tranzitivní spánek. Příklady zahrnující „mít tuto hodnotu jako řešení“ jsou skutečně reálné nebo existují shoda modulo n Navrhl jsem interně. Ogniho vztah ekvivalence indukuje třídy ekvivalence che ripartiscono l'insieme in blocchi disgiunti.

Relazioni d'ordinace: riflessive, antisimmetriche a tranzitive. Esempi: ≤ sui numeri naturali, l'inclusione ⊆ sull'insieme delle parti P(X), o „rozdělit“ (|) sui naturali. Fondamentální spánek podle definice úplné nebo částečné příkazy a pro každou oblast jsou uvedeny její massimi, minimi, kateny a antiřetězce.

objednávka lesikografickýTo jsem říkal. Je to pořadí v sekvenci (řetězec, číslo zapsané v sekvenci), které porovnává prvek po prvku; V této struktuře je důležitý šum a algoritmy zanedbávám.

Tato část je užitečná pro pochopení toho, že „relace“ v matematice je koncept più ampio della sole correlazione: zahrnují uguaglianze, ordini, kompozici a mnoho dalšího, vše nepostradatelné pro modelářský systém complessi.

Praktický pracovní postup: kontrolujte jeho výsledky

Možný pracovní proud takže to neztratíte, pokud používáte nástroj a kde:

  • Grafická inspekce: bodový graf, vyhlazování, istogrammi, QQ-plot. Occhio a outlier e form non lineari.
  • KontrolaPokud to funguje, otestujte normalitu; Pokud se předpokládá lineární model, otestujte normalitu.
  • Výběr koeficientů: Pearson (lineare, dati circa normali), Spearman/Kendall (monotónní/non normale/piccoli campioni).
  • Kategorický: chi-quadro/Fisher + misure d'associazione (V di Cramér, coeff. di contingenza, φ). Pro skupinové srovnání t-test/ANOVA nebo jiný.
  • Confundenti: korelační parziale nebo multivariační model (včetně kategorie fattori).

Zkoušíš, jak se ti táhne, interpretováno v kontextu Je to hlavní: grandezza dell'effetto, significative statistica, ampiezza del campione a qualità dei dati contano como (ne-li più) del numero finale.

Příklady kodexu R recorrenti

Už žádné hodnocení chiamate utili což umožňuje přesnější analýzu vztahu mezi proměnnými a které lze přizpůsobit vaší datové sadě:

# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")

# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)

# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)

# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab)  # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab)  # V di Cramér e coeff. di contingenza

# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)

# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))

Praktická poznámka: škrt „giuste“ závisí na datech. Stojí za to ověřit hypotézu, porovnat metodu a pokud funguje, vytvořit pikolový skript pro rychlou a spolehlivou diagnostiku otázky.

Abbiamo viděl, že „relazione“ může znamenat častěji než ne: lineární formu s Pearsonem, monotónnost se Spearmanem/Kendallem, řídkou asociaci v rámci kategorie s chi-quadro/Fisher a nespokojenost s V di Cramér a φ; senza dimenticare dohoda mezi giudici (Kappa) a managementem jsem uvedl concondenti s parziale korelací. Proto relační algebra fornisce i mattoni concettuali perdefine dominio, inversa e composizione, mentre relační algebra řídí režim, ve kterém archivuji a interroghiamo i dati nei databáze. Hlavní myšlenkou je scegliere lo strumento in base al type di variabili, alla form del legam e agli obiettivi dell'analisi, ricordandoci che nessun koeficient, da solo, può raccontare tutta la storia.

Související článek:
13 typů matematických funkcí (a jejich charakteristiky)