由於變異性而產生的數學關係類型:理論、檢驗與應用

最後更新: 十一月25,2025
作者: 虛擬教師
  • 根據遊戲形式、常態性和規模選擇 Pearson、Spearman 或 Kendall。
  • 每個變數類別均採用 chi-quadro/Fisher 和 V di Cramér 或 φ 的關聯。
  • Valuta confondenti con correlazione parziale 並支援圖形和診斷分析。
  • 關係代數(insiemi、funzioni、composizione)建立了 pensiero 和資料庫中的應用程式。

relazione tra due variabili

Capire che 型的legam c'è tra due variabili 它是統計應用、數據和實驗測試中最常用的方法之一。 定量另一種關係是線性的,並且總是 cogliere 的一部分;另一種返回的方式是單調的,但非線性的;oppure coinvolge category and non numeri;錨點取決於第三個變數 confonde le acque: insomma, non è una passeggiata.

在這本義大利語的實用理論指南中,我們將以有機的方式進行討論。 由於變異性,數學關係的主要提示、如何透過視覺診斷和正式測試、使用的定性係數(Pearson、Spearman、Kendall)、如何改變變數分類變數(chi-quadro di indipendenza、test esatto di Fisher、V di Cramér、coefficiente di contingenza、phi)、如何 測量和弦 與 Kappa 合作以及如何管理它 variabili di confundimento 處理部分相關性。此外,我們將改進南部的窗。關係代數 (在非對稱性和計算意義上),形式化概念的本質是領域、組合、反面和函數。

我們所說的「放鬆」是指由於變化而產生的

用數學語言來說,A 和 B 的關係是 笛卡兒積 A×B 的概要: ogni coppia ordinata (a, b) appartenente a R 表示元素 a di A 與元素 b di B 「相關」。在應用術語中, 確定性關係(函數) oppure probabilistica (associazione stochastica):第一種情況是 ad ogni a 對應 esattamente una b,第二種情況是 osserviamo una tendenza (più 或不太強)和 non un lawam uno-a-uno。

所有「關係的內部代數(在語意學意義上)都是有趣的proprietà come 步槍 (ogni a è 與其自身相關), 對稱 ((a,b)蘊含(b,a)), 反對稱 (若 (a, b) 且 (b, a) 則 a = b) 及物性 (由 (a, b) 和 (b, c) 可得 (a, c))。這位關鍵的屬性所有者: 如果一個關係是對稱的,那麼它就是對稱的且傳遞的。 成為一 等效關係 che “partiziona” A in classi di elementi 當量。如果 invece 是步槍、反對稱和傳遞的,我們 abbiamo una relazione d'ordine.

本文將此理念付諸實踐: 我們評估變異的類型 (定量連續、ordinali、nomonii/dicotomiche) 在此統計數據中排名 並了解“關係”並不總是意味著“因果”。

Visual ispezione:吃 riconoscere 圖案和方向

Prima di buttarsi nei numeri, 聯合國 散點圖 這是最智慧之物的重量。一朵沿著直線延伸的雲暗示著… 線性關係 (正或負);建構指示曲線 非線性關係 (ma magari monotone)。如果你不引入某種模式,線性關係可能會破壞認同感。

幾乎沒有變化,散點圖(例如在 R 中) 配對(數據))以及容易模糊的線(ggplot2 中的 geom_smooth),因此您可以注意 關聯性、聚類和異常值. 警告: gli 異常值 流感病毒 moltissimo i 係數,皮爾遜幣。

例如,在 R si può iniziare così 中: 配對(數據)

# Matrice di grafici a dispersione
pairs(dati)

# Correlazioni grezze (matrice)
cor(dati, use = "pairwise.complete.obs")

初步目測結果,與數字相符 前往 scegliere il test giusto 基於形式、單調性和線性特徵。

檢查其正常性:提供 davvero 時

Molti 參數檢定(例如 Pearson 檢定)我假設,在不同程度上, 常態 almeno 是對稱結構,程式碼量不大。為了控制 ipotesi,圖形結構的特定部分會用到。 密度等圖 e QQ圖.

在 R 語言中,una 最低電池 potrebbe includere:

# Istogrammi con densità e curva normale sovrapposta
par(mfrow = c(2, 2))
plot_hist <- function(x) {
  hist(x, prob = TRUE)
  lines(density(x), col = "red")
  curve(dnorm(x, mean(x), sd(x)), add = TRUE, col = "blue")
}
plot_hist(dati$GASTEDU)
plot_hist(dati$GASAUDE)
plot_hist(dati$GASLAZER)
plot_hist(dati$IDADE)

為了將定量觀察結果與正常標準進行比較, QQ圖 不可取代的:

par(mfrow = c(2, 2))
qqfun <- function(x) {
  qqnorm(x, main = "", xlab = "Quantili teorici N(0,1)", pch = 20)
  qqline(x, col = "red", lty = 1)
}
qqfun(dati$IDADE)
qqfun(dati$GASAUDE)
qqfun(dati$GASLAZER)
qqfun(dati$GASTEDU)

如果我不能用它,就把它放在視線範圍內。 正規化測試 每個累積證據:帶有參數估計的 Kolmogorov-Smirnov、Lilliefors、Cramér-von Mises、Shapiro-Wilk、Shapiro-Francia、Anderson-Darling 和 Pearson (chi-quadro) 正常測試。

normalita <- function(x) {
  t1 <- ks.test(x, "pnorm", mean(x), sd(x))            # Kolmogorov–Smirnov
  t2 <- nortest::lillie.test(x)                         # Lilliefors
  t3 <- nortest::cvm.test(x)                            # Cramér–von Mises
  t4 <- shapiro.test(x)                                 # Shapiro–Wilk
  t5 <- nortest::sf.test(x)                             # Shapiro–Francia
  t6 <- nortest::ad.test(x)                             # Anderson–Darling
  t7 <- PearsonDS::pearson.test(x)                      # Pearson chi-quadro di normalità
  pv <- c(t1$p.value, t2$p.value, t3$p.value, t4$p.value, t5$p.value, t6$p.value, t7$p.value)
  data.frame(p_value = pv, row.names = c(t1$method, t2$method, t3$method, t4$method, t5$method, t6$method, t7$method))
}
normalita(dati$GASAUDE)

如果我正常地和人發生性關係,關係是線性的皮爾森係數是凱爾特人的好表親;否則,謹慎的做法是將 basate sui ranghi 與 Spearman 或 Kendall 混合使用。

相關:  單位圓:三角函數及其應用

定量變異性之間的關係:協方差和相關性

La 協方差 問題在於協方差 depende dall'unità di misura, quindi è poco comparabile.

La 皮爾遜線性相關性 解決標準差標準化的問題:係數 r 的值範圍為 -1 到 1,其值為 ±1。 強線性關係 (正或負)和 0 表示 assenza di Linearità。請注意: R = 0 不排除非線性關係。

Calcoli per correlazioni 在 R 語言中:

# Coefficiente di Pearson e test di significatività
cor(dati$GASTEDU, dati$GASAUDE, method = "pearson")
cor.test(dati$GASTEDU, dati$GASAUDE, method = "pearson")

Quando la relazione è 單調且非線性 或者當我睡眠不正常(或睡眠異常)時,使用就很有意義了。 斯皮爾曼 (ranghi;穩健且適應medio-grandi Campioni) 肯德爾 (basato su concordanze/discordanze;preferibile su 小冠軍們 (或有很多帕雷吉):

# Correlazioni non parametriche
cor.test(dati$GASTEDU, dati$GASAUDE, method = "spearman")

# Su un sottoinsieme più piccolo, meglio Kendall
dati2 <- head(dati, 20)
cor.test(dati2$IDADE, dati2$GASAUDE, method = "kendall")

一個有用的想法: 決定係數 R² di un 簡單線性模型 從 X 線性地恢復 Y spiegata 的可變份額。在 R 中:

summary(lm(GASAUDE ~ ESTCIVIL, data = dati))$r.squared

每變數二分法與量化法的係數 點雙序列 這與使用編碼變數 0/1 的 Pearson 計算結果一致;實際上, 顏色(二分法,定量) con 方法 = “pearson”。

變數類別:indipendenza、關聯強度和 piccoli Campioni

睡眠變異性出現時 nominali od ordinali, la relazione si studia con tabelle di contingentza (常使用多普亞分類)。典型的 ipotesi 是:H0 = indipendenza(必要關聯),對照 H1 = dipendenza。

Il test di riferimento è il 獨立性四方. Se ci sono frequenze attese troppo basse (通常小於 5),如果您使用它 耶茨的更正 per 2×2 o si passa al 費雪測試尤其適用於小坎皮奧尼。

# Tabella incrociata e chi-quadro
xtabs(~ PROFI + ESTCIVIL, data = dati) -> tab1
chisq.test(dati$PROFI, dati$ESTCIVIL)  # p-value non significativo => indipendenza plausibile

# Campioni piccoli: test di Fisher
chisq.test(dati$PROFI, dati$RENDA)
fisher.test(dati2$PROFI, dati2$RENDA)

每 Quantcare 協會強度 在 tabelle I×J si usano: V di Cramér (0-1), 條件係數 (0–1,限制),以及 2×2 il phi (φ),其正式名稱為 Pearson applicato alla tabella binaria。

# Misure di associazione per tabelle
library(vcd)
xtabs(~ PROFI + RENDA, data = dati) -> tab2
assocstats(tab2)  # riporta V di Cramér, coeff. di contingenza e test

# Attenzione: cor() su codifiche numeriche di categorie non è equivalente a φ in generale

Se l'intersse è conversationore gruppi 及其數量變異性 (es. reddito per professionale),如果 valuetano t檢驗, 方差分析 這是非參數化的替代方案,沒有間隔的機密。一般來說, 變異類型和方法的一致性 這是根本。

相關:  如何對含單項式的分數進行加減運算:規則、情況和範例。

估價協奏曲:Kappa di Cohen

當 due (或 più) giudici 在類別中分類 no gli stessi oggetti 時,混合同意的百分比是不夠的,perché aquota può essere dovuta al 案件。 “ 卡帕·迪·科恩 量化非正式協議的正確性:我進一步賦予其 0 值,表示每種情況下的協議,我賦予其 maggiori suggeriscono 值 日益增長的共識 (comuni 的解釋:carso、謹慎、moderato、buono、molto buono)。

In Rè possibile stimare Kappa anche in 龐德拉塔版本 (依普通類別):

set.seed(1)
val1 <- sample(0:1, 10, replace = TRUE)
val2 <- sample(0:1, 10, replace = TRUE)

# Kappa non ponderato
fmsb::Kappa.test(val1, val2)

如果該類別不是自然秩序 (ad empio,lieve/moderata/severa),Kappa ponderato penalizza 小調分歧“vicini”和 più quelli“lontani”,導致 spesso più 資訊豐富。

混亂的關係與變化:la correlazione parziale

Può capare che due variabili X e Y sembrino molto correlate, but in realtà la Strength dell'associazione sia dovuta a una variabile di confundimento Z 與入口相關。問題是,如果您點擊它 偏相關 tra X 和 Y 控制 Z。

在 R 中,使用 ggm::pcor si ottiene la correlazione parziale di primo ordine e si può testne lasignificatività。比較有用 經典 r e r parziale 根據 Z “spiega” del Legam grezzo 的描述。

library(ggm)
# Correlazione parziale tra GASLAZER e GASAUDE controllando GASTEDU
rp <- pcor(c("GASLAZER", "GASAUDE", "GASTEDU"), var(dati))

# Correlazione grezza
r  <- cor(dati$GASLAZER, dati$GASAUDE)

# Test della correlazione parziale (1 variabile di controllo)
pcor.test(rp, 1, length(dati$GASAUDE))

# Confronto R^2 grezzo vs parziale
data.frame("Senza_controllo" = r^2, "Con_controllo" = rp^2)

如果 spiegata 配額「crollas」 dopo il controllo,現在 Z是一位重要的南方邦聯成員。當控制變數是類別(例如 professione)時,我不能使用將類別作為因子的類似方法或模型。

相關性使用的限制和良好實踐

皮爾遜混合係數 僅線性如果關係是非線性的(二次、自旋、對數),在強依賴性的情況下,結果可能為 0。在這種情況下,評估 斯皮爾曼將其轉換為非線性模型。

局外人 我無法篡改結果。因此,首先,最好查看圖表,如有必要,同時進行穩健性分析或檢查結果的敏感度。

另一部經典之作: 相關性≠因果關係。由於變異性,我無法將流感的棲息睡眠與第三個脂肪相關聯,這只是巧合或反向機制的影響。實驗伺服設計、因果關係模型或適用於因果效應的模型。

關係類型:線性關係、單調關係、零關係、分類關係

Nei casi missi(定量與二分法/名義/排序)se 通過了 gruppi、correlazioni biseriali/point-bseriali oa 之間對抗的測試 楷模 (例如,使用預測因子進行迴歸分析)。具有變異性 entrarbe categoriali, ci si affida a chi-quadro/Fisher e alle misure di Strength dell'associazione già viste.

Funzioni 吃特殊關係

功能 它是一種關係,根據域中的一個元素,將…關聯起來。 恰好是一個元素 公寓。總之,這是一個 A×B 的 sottoinsieme 故事,其中 ogni a 在 A 中與第一個分量進行比較。睡眠相關代數中的其他重要運算: 聯盟 (R1 ∪ R2), 路口 (R1 ∩ R2), 組成 (R2 ∘ R1)和 撤銷 (R^{-1}, (b, a) 中的 che Cambia ciascuna coppia (a, b))。

這些 概念馬托尼 tornano utili sia nella 純數學 (equivalenze, ordini, classi di equalenza) sia in applicazioni 具體鴿子服務於實體關係的形式化。

我教的關於關係和科學的代數

Nel mondo dei database, l'關係代數 這是 SQL 的理論結構:如何操作 選擇、proiezione、join、unione 和 intersezione Sono versioni Pratiche di operazioni su relazioni-insiemi。這種形式化是快速描述、優化和操作事物的強大武器。

相關:  如何在TI-84 Plus計算器上輸入分數

之內 人工智能 機器學習能夠對關係進行建模,從而建立認知圖、推薦系統和整合流程;這一價值在經濟學、生物統計學和社會科學領域都適用,幾乎總是「chi 是連奏 chi,並且處於 che 模式“。

理論中關係的經典例子

Relazioni di 等效性:睡眠反射性、對稱性和傳遞性。例如,「將此值作為解決方案」是真實存在的,或者存在。 模 n 的同餘 我內部建議。等價關係的奧格尼引發 classi di equivalenza che ripartiscono l'insieme in blocchi disgiunti。

Relazioni d'奧丁:步槍、反對稱和及物。 Esempi:≤ 自然數,l'inclusione ⊆ sull'insieme delle parti P(X),o “除法”(|) 自然數。根據定義的基本睡眠 ordinamenti totali o parziali 每個區域都有其最大鏈、最小鏈、鏈狀鍊和反鏈。

秩序報 簡明版畫我就是這麼說的。這是一個序列(字串、按順序排列的數字)的排序,逐個元素進行比較;這種結構中存在重要的噪聲,而且我忽略了演算法。

本節有助於理解數學中的「relazione」是一個概念。 più ampio della sole correlazione:包括 uguaglianze、ordini、composition 等等,這些都是 modellare 系統 complessi 所不可缺少的。

實際工作流程:控制結果

一個可能的 工作流程 這樣,如果你使用樂器,就不會失去它,以及它在哪裡:

  • 圖形檢查:散佈圖、平滑圖、直方圖、QQ 圖。 Occhio 是一個非線性的異常值。
  • 查看:如果有效,則測試常態性;如果預期使用線性模型,則進行變異數控制。
  • 係數選擇:Pearson(線性、正常資料)、Spearman/Kendall(單調/非正常/piccoli Campioni)。
  • 分類:chi-quadro/Fisher + misure d'associazione(V di Cramér,coeff. di contingenza,φ)。對於組別比較,t 檢定/變異數分析或替代方法。
  • 混淆:關聯 parziale 或多變量模型(包括 fattori 類別)。

Qualunque sia la scelta, interpretae nel contexto 這就是關鍵:grandezza dell'effetto、有意義的統計數據、ampiezza del Campione e qualità dei dati contano como(如果不是più)del numero Finale。

Esempi di codice R ricorrenti

Riassumendo alcune chiamate utili 這使得它在分析變數之間的關係時更加準確,並且可以根據您的資料集進行調整:

# 1) Correlazioni
cor(x, y, method = "pearson")
cor.test(x, y, method = "spearman")
cor.test(x_small, y_small, method = "kendall")

# 2) Grafici (base e ggplot2)
plot(x, y)
# ggplot2: geom_point() + geom_smooth(method = "lm" o se = FALSE)

# 3) Normalità
shapiro.test(x)
nortest::ad.test(x)

# 4) Tabelle e test
xtabs(~ a + b, data = dati) -> tab
chisq.test(tab)
fisher.test(tab)  # campioni piccoli o celle con attesi < 5
vcd::assocstats(tab)  # V di Cramér e coeff. di contingenza

# 5) Kappa
afmsb::Kappa.test(giudice1, giudice2)

# 6) Correlazione parziale
ggm::pcor(c("x", "y", "z"), var(dati))

實用說明:le scelte “giuste” dipendono dai dati. 值得驗證假設,比較方法,並在有效的情況下構建一個 piccolo 腳本,以便快速可靠地診斷問題。

阿比亞莫認為「relazione」通常意味著:Pearson 的線性形式、Spearman/Kendall 的單調、chi-quadro/Fisher 範疇內的薄弱關聯以及 V di Cramér 和 φ 的 misure;senza dienticare giudici (Kappacare) 和管理層之間的協議我用 parziconfale.因此,關係代數在定義領域、逆向和組合方面都指導著我歸檔和查詢資料庫的模式。 主要想法是 scegliere lo strumento in base al type di variabili, alla forma del Legam e agli obiettivi dell'analisi, ricordandoci che nessun 係數, da Solo, può raccontare tutta la storia。

相關文章:
13 種數學函數(及其特徵)