GRADE-System
Trainier deine Lernmuskeln!
Mit Flash Cards, Quiz und mehr
LoslegenSynonyme: GRADE-Ansatz, GRADE-Methodik
Englisch: GRADE approach, GRADE framework
Definition
Das GRADE-System ist ein Verfahren zur Bewertung der Sicherheit wissenschaftlicher Evidenz und zur Formulierung von Empfehlungen in Leitlinien.
Terminologie
Das Akronym GRADE steht für Grading of Recommendations Assessment, Development and Evaluation.
Hintergrund
GRADE wird seit 2000 von der internationalen GRADE Working Group entwickelt, um die Bewertung von Evidenz und die Formulierung von Empfehlungen zu standardisieren und transparenter zu gestalten.[1] Es wird u.a. von der WHO und von Cochrane angewendet. Ein zentrales Merkmal ist die getrennte Bewertung von Evidenzsicherheit und Empfehlungsstärke. Sie erleichtert die Einschätzung, wie belastbar eine Empfehlung ist und welcher Spielraum für individuelle Entscheidungen besteht.
In deutschen Leitlinien, insbesondere S3-Leitlinien und Nationalen Versorgungsleitlinien, wird GRADE häufig für die Bewertung der Evidenz genutzt oder adaptiert. Die Empfehlungen selbst werden nach dem AWMF-Regelwerk jedoch meist dreistufig graduiert:[2]
- "soll" – starke Empfehlung
- "sollte" – abgeschwächte Empfehlung
- "kann" – offene Empfehlung
Diese Einteilung sorgt für eine stringente Empfehlungsstruktur. Die stereotype Verwendung der Modalverben schränkt jedoch die Lesefreundlichkeit der Leitinien ein.
Bewertung der Evidenzsicherheit
Die Evidenzsicherheit wird für jeden relevanten Endpunkt getrennt anhand der Gesamtheit der verfügbaren Studien beurteilt, nicht für einzelne Studien.[2] Ausgangspunkt ist das Studiendesign: Randomisierte kontrollierte Studien werden zunächst hoch eingestuft, Beobachtungsstudien niedrig. Wird das Verzerrungsrisiko nicht-randomisierter Studien mit dem Instrument ROBINS-I bewertet, starten auch diese zunächst hoch und werden über die Domäne Risk of Bias entsprechend herabgestuft.[3] Anschließend wird die Einstufung anhand definierter Kriterien herab- oder heraufgestuft.
GRADE unterscheidet vier Stufen der Evidenzsicherheit:[4]
| Stufe | Bedeutung |
|---|---|
| hoch | Es besteht großes Vertrauen, dass der tatsächliche Effekt nahe beim geschätzten Effekt liegt. |
| moderat | Der tatsächliche Effekt liegt wahrscheinlich nahe beim geschätzten Effekt, eine erhebliche Abweichung ist jedoch möglich. |
| niedrig | Das Vertrauen in den geschätzten Effekt ist begrenzt; der tatsächliche Effekt kann erheblich davon abweichen. |
| sehr niedrig | Das Vertrauen in den geschätzten Effekt ist sehr gering; der tatsächliche Effekt weicht wahrscheinlich erheblich davon ab. |
Kriterien für eine Herabstufung
- Risiko systematischer Verzerrungen
- Inkonsistenz der Ergebnisse
- Indirektheit der Evidenz
- Ungenauigkeit der Effektschätzung (z.B. breite Konfidenzintervalle, geringe Fallzahl)
- Publikationsbias
Kriterien für eine Aufstufung
Vor allem bei Beobachtungsstudien kann die Evidenzsicherheit heraufgestuft werden, sofern kein Grund für eine Herabstufung vorliegt. Die Kriterien sind:
- ein großer oder sehr großer Effekt
- eine Dosis-Wirkungs-Beziehung
- plausible residuale Störfaktoren, die den beobachteten Effekt eher abschwächen als verstärken würden
Stärke der Empfehlung
Die Stärke der Empfehlung wird getrennt von der Evidenzsicherheit beurteilt. GRADE unterscheidet starke und bedingte Empfehlungen, jeweils für oder gegen eine Intervention. Bedingte Empfehlungen werden auch als konditionale oder schwache Empfehlungen bezeichnet. Starke Empfehlungen werden typischerweise mit "wir empfehlen" formuliert, bedingte mit "wir schlagen vor".
Neben der Evidenzsicherheit fließen in die Empfehlungsstärke ein:[5]
- das Verhältnis von erwünschten und unerwünschten Effekten (Nutzen-Risiko-Verhältnis)
- Werte und Präferenzen der Patienten
- Ressourcenverbrauch
- Auswirkungen auf die gesundheitliche Chancengleichheit
- Akzeptanz und Umsetzbarkeit
Eine hohe Evidenzsicherheit führt daher nicht automatisch zu einer starken Empfehlung. Umgekehrt kann in begründeten Ausnahmefällen auch bei niedriger Evidenzsicherheit eine starke Empfehlung ausgesprochen werden, etwa bei lebensbedrohlichen Situationen oder möglichem schwerem Schaden einer Intervention.
Praktische Anwendung
Die Anwendung von GRADE beginnt mit einer strukturierten klinischen Fragestellung, meist nach dem PICO-Schema (Population, Intervention, Vergleich, Endpunkt). Anschließend werden die patientenrelevanten Endpunkte festgelegt und auf einer 9-Punkte-Skala gewichtet. Für jeden kritischen und wichtigen Endpunkt wird die Evidenz gesondert bewertet. Die Gesamtsicherheit der Evidenz richtet sich in der Regel nach der niedrigsten Sicherheit unter den kritischen Endpunkten.[1]
Auf dieser Grundlage wird die Empfehlung mithilfe eines Evidence-to-Decision-Frameworks formuliert.[5] Für die Umsetzung stehen digitale Werkzeuge wie GRADEpro oder MAGICapp zur Verfügung.
Darstellung der Ergebnisse
GRADE-Ergebnisse werden typischerweise in Evidenzprofilen und Summary-of-Findings-Tabellen dargestellt. Diese fassen für die ausgewählten Endpunkte die Richtung und Größe des Effekts, absolute und relative Effekte sowie die Evidenzsicherheit zusammen. Evidenzprofile enthalten zusätzlich die Beurteilung der einzelnen GRADE-Domänen.[6]
Einschränkungen
Die Anwendung von GRADE erfordert erheblichen methodischen Aufwand, da für mehrere Endpunkte getrennte Bewertungen, strukturierte Tabellen und Abstimmungen nötig sind. Trotz des standardisierten Vorgehens bleiben Ermessensspielräume, etwa bei der Gewichtung von Endpunkten, der Bewertung einzelner Domänen und der Ableitung der Empfehlung. Unterschiedliche Bewertungsteams können daher im Einzelfall zu abweichenden Einschätzungen kommen. GRADE soll diese Urteile transparent machen, nicht ersetzen.[6]
Quellen
- ↑ 1,0 1,1 Guyatt GH, Oxman AD, Vist GE, Kunz R, Falck-Ytter Y, Alonso-Coello P, et al. GRADE: an emerging consensus on rating quality of evidence and strength of recommendations. BMJ. 2008;336(7650):924-6.
- ↑ 2,0 2,1 AWMF-Ständige Kommission Leitlinien. AWMF-Regelwerk „Leitlinien“. Version 2.2 vom 22.05.2025.
- ↑ Schünemann et al. GRADE guidelines: 18. How ROBINS-I and other tools to assess risk of bias in nonrandomized studies should be used to rate the certainty of a body of evidence. J Clin Epidemiol. 2019;111:105-14.
- ↑ Balshem et al. GRADE guidelines: 3. Rating the quality of evidence. J Clin Epidemiol. 2011;64(4):401-6.
- ↑ 5,0 5,1 Alonso-Coello et al. GRADE Evidence to Decision (EtD) frameworks: a systematic and transparent approach to making well informed healthcare choices. 1: Introduction. BMJ. 2016;353:i2016.
- ↑ 6,0 6,1 Schünemann H, Brożek J, Guyatt G, Oxman A, editors. GRADE Handbook, abgerufen am 28.09.2026
Weblink
- GRADE Working Group, abgerufen am 28.09.2026