TATECHATLAS
◎ Deutsch
Mathematik und Modelle

Kombinieren Sie Gruppenmittelwerte mit ihren tatsächlichen Nennern

Erfahren Sie, warum Gruppen unterschiedlicher Größe ein kombiniertes Mittel von 18 statt 15 ergeben, mit einem kurzen Python-Beispiel.

Auf dieser Seite

Um arithmetische Mittel kompatibler Beobachtungen zu kombinieren, gewichten Sie jedes Gruppenmittel mit der Anzahl der Beobachtungen, die tatsächlich für dieses Mittel verwendet wurden. Eine Gruppe von zwei mit Mittelwert 10 und eine Gruppe von acht mit Mittelwert 20 ergeben (2*10 + 8*20)/10 = 18. Ihr ungewichtetes Mittel der Mittelwerte ist 15 und beantwortet eine andere Frage. Bewahren Sie die Nenner zusammen mit jedem gemeldeten Mittelwert auf, insbesondere wenn fehlende Werte ausgeschlossen werden.

Identifizieren Sie die gemittelte Größe

Bevor Sie Zusammenfassungen kombinieren, stellen Sie sicher, dass sie die gleiche Größe in denselben Einheiten und unter kompatiblen Einschlussregeln beschreiben. Eine Antwortzeit, gemessen in Sekunden, kann nicht direkt mit einer in Millisekunden gemeldeten kombiniert werden, ohne Umrechnung. Unterscheiden Sie zudem einen Durchschnitt pro Beobachtung von einem Durchschnitt pro Gruppe. Beide können sinnvoll sein, aber sie geben einer kleinen Gruppe und einer großen Gruppe unterschiedliche Bedeutung.

Behalten Sie den Nenner, der von jedem Mittelwert verwendet wurde

Für ein arithmetisches Mittel rekonstruiert die Multiplikation des Mittelwerts mit seiner Beobachtungszahl den Gruppentotal, sofern keine Rundungsfehler vorliegen. Das Summieren dieser Totalen und das Dividieren durch die summierten Anzahlen ergibt das kombinierte Mittel für disjunkte, kompatible Gruppen. Die Anzahl muss sich auf die Beobachtungen beziehen, die zum Mittelwert beigetragen haben. Eine nominelle Abteilungsgroße ist der falsche Nenner, wenn nur einige Mitglieder den gemessenen Wert geliefert haben.

Berechnen Sie das Beispiel mit ungleichen Gruppen

Konstruieren Sie Gruppe A mit Anzahl 2 und Mittelwert 10, sodass ihr Total 20 beträgt. Gruppe B hat Anzahl 8 und Mittelwert 20, was Total 160 ergibt. Das kombinierte Total ist 180 über 10 Beobachtungen, also Mittelwert 18. Das direkte Mitteln von 10 und 20 ergibt 15, weil es beiden Gruppen gleiches Gewicht zuweist. Diese hypothetischen Zusammenfassungen zeigen den Unterschied, ohne einen beobachteten Datensatz oder Benchmark zu behaupten.

Verwenden Sie eine kurze Python-Berechnung

Python 3.11 und später unterstützen Gewichte in statistics.fmean. Das Beispiel liefert Mittelwerte und ihre passenden Anzahlen und ergibt einen erwarteten Wert von 18.0. Der Code holt keinen Datensatz ab und validiert nicht, ob die Anzahlen korrekt erhoben wurden. Behandeln Sie dies als Berechnung bereitgestellter Eingaben. Wenn Sie genaue Dezimalbuchhaltung benötigen, betrachten Sie die numerische Darstellung separat, anstatt anzunehmen, dass die Gleitkommaausgabe für alle Werte exakt ist.

from statistics import fmean

group_means = [10, 20]
observed_counts = [2, 8]
combined_mean = fmean(group_means, weights=observed_counts)
print(combined_mean)

Kombinieren Sie Prozentsätze über kompatible Anzahlen

Angenommen, eine Gruppe hat 1 Erfolg in 2 Versuchen und eine andere hat 4 in 8. Der kombinierte Erfolgsanteil ist 5/10, also 50 Prozent. Im Allgemeinen bewahren Sie Erfolgszahlen und Versuchszahlen auf, statt angezeigte Prozentsätze ohne ihre Nenner zu mitteln. Unterschiedliche Definitionen eines Versuchs oder überlappende Gruppen invalidieren eine einfache gepoolte Interpretation. Zahlen vermeiden zudem einige Informationsverluste, die durch für die Präsentation gerundete Prozentsätze entstehen.

Behandeln Sie fehlende Beobachtungen konsistent

Ein Mittelwert, der nach Ausschluss fehlender Werte berechnet wurde, muss mit der Anzahl der nicht fehlenden Beobachtungen für dieselbe Variable und dieselbe Einschlussregel gepaart werden. Unterschiedliche Spalten können unterschiedliche gültige Anzahlen haben, selbst innerhalb einer Gruppe. pandas mean kann fehlende Werte überspringen, sodass eine rohe Zeilenanzahl nicht automatisch das geeignete Gewicht ist. Wenn das Fehlen systematisch ist, entfernt korrekte Arithmetik das daraus resultierende Repräsentativitätsproblem nicht.

Diagnostizieren Sie versehentliche Gleichgewichtung

Wenn eine kombinierte Zahl überraschend aussieht, schreiben Sie jeden Mittelwert, jede Anzahl und das rekonstruierte Total auf, bevor Sie die Formel ändern. Prüfen Sie, ob die beabsichtigte Frage Gruppen oder einzelne Beobachtungen gleiche Bedeutung beimisst. Die Gleichgewichtung von Gruppenmitteln ist für eine explizit gruppeniveaubezogene Frage geeignet und kann mit dem Poolen übereinstimmen, wenn die Gruppenanzahlen gleich sind. Sie sollte nicht stillschweigend als das gesamte beobachtungsniveaubezogene Mittel präsentiert werden, wenn die Anzahlen differieren.

Erkennen Sie Grenzen des Zusammenfassungs-Poolings

Ein arithmetisches gewichtetes Mittel von Medianen stellt kein gepooltes Median wieder her. Raten wie Geschwindigkeit können je nachdem, welche Exposition konstant gehalten wird, eine andere Formel erfordern. Überlappende Gruppen können dieselbe Beobachtung mehr als einmal zählen. Gerundete Mittelwerte führen zu Rekonstruktionsfehlern, und ein Gesamtgewicht von Null lässt kein definiertes gepooltes Mittel zu. Bewahren Sie rohe Totalen und Anzahlen auf, wenn möglich, und geben Sie an, welche Informationen die Zusammenfassungen nicht enthalten.

Was Sie prüfen sollten

  • Prüfen Sie Einheiten und Einschlussregeln.
  • Bewahren Sie die tatsächliche Anzahl der nicht fehlenden Werte zusammen mit jedem Mittelwert.
  • Unterscheiden Sie beobachtungsniveau- und gruppeniveaubezogene Fragen.
  • Bevorzugen Sie für Prozentsätze die rohen Zähler- und Nennerzahlen.
  • Poolen Sie Mediane nicht mit der Mittelwertformel.

Das Poolen setzt kompatible arithmetische Mittel mit entsprechenden Anzahlen und keine unbeabsichtigte Doppelzählung voraus. Es behebt keine Bias durch fehlende Daten, stellt kein gepooltes Median wieder her und legt nicht die richtige Formel für jede Rate fest. Das Python-Beispiel mit Gewichten erfordert Python 3.11 oder höher.

Quellen

  1. Python: statistics and weighted fmean ↗
  2. pandas: DataFrame mean and missing values ↗
Nach oben ↑