MetaTrader ./wikiINDEPENDENT ENCYCLOPEDIA · N#1 SOURCE EST. 2010SECTOR INTELLIGENCE & ADVANCED MARKET ANATOMY

Strategien · Methodik · Nachweisprüfung

Backtests & Track Records: Was historische Ergebnisse wirklich zeigen

Simulation verstehen, Fehlschlüsse erkennen und den Weg von der historischen Erklärung zur prospektiven Prüfung nachvollziehen.

01.10.2026Zwei interaktive PrüflaboreUnabhängige analytische Einordnung
In diesem ArtikelEin Backtest beantwortet eine bedingte Frage.Rückblick und Zukunft unterscheiden sich im Informationsstand.Was zu einem reproduzierbaren Test gehört.MetaTrader: Testmodus ist eine Modellentscheidung.Wie eine überzeugende Kurve entsteht, obwohl der Nachweis schwach ist.Auswahllabor: Der Sieger unter vielen Zufallsversuchen.Prüflabor: Was die schöne Balance-Kurve ausblendet.Kennzahlen richtig lesen.Vom historischen Test zur prospektiven Beobachtung.Von Missverständnissen bis zur gezielten Irreführung.Der nächste sinnvolle Schritt: Nachweise anfordern.Quellen und Aussagegrenzen.

Ein Backtest beantwortet eine bedingte Frage.

Ein Backtest lässt festgelegte Handelsregeln auf historischen Daten unter festgelegten Annahmen ablaufen. Seine Frage lautet: Wie hätte diese Version der Strategie in diesem Datensatz und diesem Ausführungsmodell abgeschnitten? Er zeigt keine tatsächlich erzielte Kontoleistung und liefert allein keine belastbare Zusage für kommende Gewinne.

Das macht ihn wertvoll: Regeln lassen sich kontrollieren, Fehler entdecken, Kosten untersuchen und ungeeignete Ideen verwerfen, bevor reales Kapital eingesetzt wird. Problematisch wird der Übergang von einer rückblickenden Berechnung zu einer vorausschauenden Behauptung, wenn dessen Voraussetzungen verschwiegen werden.

Eine historische Erklärung ist noch keine Prognose. Die Qualität der Simulation, die Auswahl der Strategie und ihre Übertragbarkeit auf andere Bedingungen sind drei unterschiedliche Prüfaufgaben.

„Datenbasiert“ bedeutet zunächst nur, dass Daten verwendet wurden. Ob die Daten zeitgerecht verfügbar waren, die Regel erst nach Betrachtung des Ergebnisses entstand und die Ausführung realistisch modelliert wurde, bleibt damit offen.

Rückblick und Zukunft unterscheiden sich im Informationsstand.

Rückblickende UntersuchungEntscheidung im laufenden Markt
Der spätere Verlauf ist dem Forscher bekannt.Der weitere Verlauf ist unbekannt.
Regeln, Zeitraum und Parameter können wiederholt geändert werden.Die Entscheidung muss mit dem verfügbaren Wissen getroffen werden.
Die beste Variante lässt sich nachträglich auswählen.Welche Variante künftig passt, ist noch offen.
Ausführung und Kosten werden modelliert.Anfragen treffen auf reale Quotes, Liquidität und Betriebsbedingungen.
Fehlgeschlagene Versuche können aus der Präsentation verschwinden.Fehlentscheidungen verursachen echte Kosten und Kapitalverluste.

Eine rückwirkende Analyse muss nicht zwangsläufig Zukunftsinformation verwenden. Ein sauberer Test rekonstruiert den damaligen Informationsstand und lässt Entscheidungen chronologisch entstehen. Beispielsweise darf ein Signal auf Basis des Tagesschlusses nicht zugleich zu einem vorher bereits handelbaren Tageskurs ausgeführt werden, wenn dieser Informationsstand erst später vorlag.

Der Unterschied bleibt dennoch bestehen: Der Forscher kann den Verlauf kennen, selbst wenn der Programmcode nur vergangene Preise liest. Die Kenntnis einer späteren Krise kann bereits die Wahl des Instruments, Filters oder Testzeitraums beeinflussen. Deshalb genügt „kein Zukunftszugriff im Code“ nicht als Beleg gegen alle rückblickenden Verzerrungen.

Prognostische Tragfähigkeit verlangt zusätzliche Annahmen: Der untersuchte Zusammenhang muss fortbestehen, die verfügbaren Daten müssen vergleichbar sein und die Strategie muss tatsächlich ausführbar bleiben. Ein Zinsregime, eine Marktstruktur, Wettbewerber oder Brokerbedingungen können sich ändern. Die Zukunft ist keine weitere Zeile derselben unveränderlichen Versuchsanordnung.

Was zu einem reproduzierbaren Test gehört.

  1. Strategie einfrieren: Version, Parameter, Signalzeitpunkt, Positionsgröße, Ausstieg und Risikogrenzen vor der Bewertung festhalten.
  2. Daten dokumentieren: Quelle, Zeitraum, Zeitzone, Bid/Ask/Last, Auflösung, Lücken und Korrekturen. Bei Aktien auch damals verfügbare Unternehmen und Kapitalmaßnahmen berücksichtigen.
  3. Ausführung beschreiben: Signalpreis und handelbarer Preis trennen; Orderart, Latenz, Spread, Slippage und Teilfüllungsannahmen nennen.
  4. Kontomodell festlegen: Kapital, Hebel, Margin, Währungsumrechnung, Finanzierung, Kommission und mögliche Zwangsschließungen.
  5. Auswahlprozess protokollieren: Nicht nur den Gewinner speichern, sondern untersuchte Varianten und die vorab gewählte Bewertungsgröße.
  6. Ergebnis vollständig zeigen: Trades, offene Positionen, Equity, Balance, Drawdown, Kosten und Fehlerjournal exportieren.
  7. Unabhängig nachprüfen: Gleiche Regeln mit nachvollziehbaren Daten wiederholen; Abweichungen erklären und dokumentieren.

Ein Screenshot lässt weder Datenqualität noch Auswahlprozess rekonstruieren. Eine zweite Auswertung derselben Datei prüft Berechnungen, aber bestätigt nicht automatisch die Echtheit oder Vollständigkeit der Ausgangsdaten. Ein Dateihash schützt die Zuordnung einer Version; er beweist nicht, dass die Handelsdaten wahr sind.

MetaTrader: Testmodus ist eine Modellentscheidung.

MT5 unterscheidet unter anderem reale Ticks, generierte Ticks, 1-Minuten-OHLC und Open-Prices-Tests. Die Eignung hängt davon ab, ob eine Strategie auf Bewegungen innerhalb einer Kerze reagiert. Ein Test nur an Eröffnungskursen kann eine intrabarabhängige Logik nicht gleichwertig prüfen. Der Tester bietet Verzögerungsmodelle; der Modus ohne Verzögerung bildet ausdrücklich idealisierte Bedingungen ab. Bei Gewinnberechnung in Pips entfallen laut Dokumentation Swap, Kommission und Marginprüfung. [1]

Reale Ticks sind näher am beobachteten Kursverlauf, keine Vollständigkeitsgarantie. Die MT5-Dokumentation beschreibt auch erzeugte Ticks als Ersatz, wenn zu einer vorhandenen Minutenkerze Tickdaten fehlen. Bei realen Ticks kann sich der Spread innerhalb der Minute ändern; bei generierten Ticks wird der entsprechende Minuten-Spread verwendet. Ein Last-Chart ersetzt zudem nicht die für den Handel maßgeblichen Bid-/Ask-Preise. [2]

Eine hohe Modellierungsqualität sagt für sich genommen nichts über wirtschaftliche Tragfähigkeit, unabhängige Auswahl oder künftige Profitabilität aus. Auch gute Kursdaten kennen nicht automatisch Ihre reale Position in einer Orderwarteschlange, jedes abgelehnte Orderticket oder den Marktimpact einer großen Position.

MT4 und MT5 sollten nicht über scheinbar identische Reportlabels gleichgesetzt werden. Testdaten, Modelle und Handelsmechanik prüfen. Die MT4-/MT5-Anleitung zum StrategietesterBacktests & Track Records beschreibt die Bedienung; diese Seite beurteilt die Aussagekraft. Ergänzend: Ausführungsqualität, Kontraktdaten und Kostenmodelle.

Wie eine überzeugende Kurve entsteht, obwohl der Nachweis schwach ist.

SchwachstelleMechanismusKontrollfrage
Look-ahead / DatenleckSpäter bekannte Preise, revidierte Daten oder zukünftige Merkmale fließen in frühere Entscheidungen.Wann war jede Information tatsächlich verfügbar?
OverfittingDie Regel passt sich Besonderheiten des bekannten Datensatzes an.Bleibt die Leistung bei benachbarten Parametern und neuen Daten bestehen?
Data Snooping / MehrfachauswahlViele Varianten werden getestet; der beste Treffer wird allein gezeigt.Wie viele Versuche gingen der gezeigten Version voraus?
Survivorship BiasGescheiterte Instrumente, Konten oder Strategien fehlen.Welche Elemente waren damals verfügbar und wurden später entfernt?
Cherry-PickingGünstige Perioden, Symbole oder Kennzahlen werden hervorgehoben.Wie sieht die vorher festgelegte vollständige Auswertung aus?
Unrealistische FillsJeder gewünschte Kurs gilt als verfügbar, unabhängig von Orderart und Marktbedingungen.Welche Annahme erzeugt den Fill und wann scheitert sie?
Verborgener offener VerlustBalance enthält geschlossene Gewinne, während Verlustpositionen weiterlaufen.Wo liegt der schlechteste Equity-Wert?
Unvollständige KostenSpread, Gebühren, Finanzierung oder Slippage fehlen oder sind zu günstig.Bleibt nach realistischen Kosten ein Ergebnis übrig?

Bailey, Borwein, López de Prado und Zhu untersuchen die Auswahlverzerrung durch Backtest-Optimierung. Ihr Ansatz betrachtet unter anderem die Beziehung zwischen In-Sample-Auswahl und Out-of-Sample-Leistung. Ein einfacher zurückgehaltener Datensatz beantwortet nicht automatisch, wie stark vorherige Mehrfachversuche die Auswahl beeinflusst haben. Ihre Forschung ist keine pauschale Diagnose jedes EAs; sie begründet, weshalb der gesamte Auswahlprozess Teil des Nachweises sein muss. [3]

Robuste Ergebnisse müssen nicht spektakulär aussehen. Ein breiter Bereich ähnlicher Ergebnisse bei benachbarten Parametern ist anders zu beurteilen als ein einzelner schmaler Spitzenwert. Auch ein solcher Bereich ist kein Zukunftsbeweis: Die ganze Parameterfamilie kann von derselben historischen Marktphase abhängen.

Auswahllabor: Der Sieger unter vielen Zufallsversuchen.

Alle Kandidaten in diesem Lehrmodell haben denselben erwarteten Bruttowert von null. Jeder besitzt 60 zufällig erzeugte historische Ergebnisse und 60 weitere unabhängige Ergebnisse. Gewählt wird ausschließlich nach dem höchsten historischen Gesamtgewinn. Die zweite Hälfte beeinflusst die Auswahl nicht.

Eigene synthetische Simulation: je Schritt unabhängig +10 oder −10 Geld mit gleicher Wahrscheinlichkeit; konstante Größe, keine Kosten, keine echten Kurse. Der Startwert macht das Experiment reproduzierbar. Bei gleichem Startwert sind kleinere Kandidatenmengen Teilmengen größerer Mengen. Kein Test realer Strategien, keine PBO-Berechnung und keine Wahrscheinlichkeit für künftigen Erfolg.

Der ausgewählte Kandidat kann im zweiten Abschnitt gewinnen oder verlieren. Beides ist möglich. Ein einzelnes weiteres positives Ergebnis beweist deshalb noch keinen Vorteil. Ändern Sie den Startwert bewusst und vergleichen Sie mehrere vollständige Experimente. Nur angenehme Experimente zu behalten würde denselben Auswahlfehler erneut erzeugen.

Prüflabor: Was die schöne Balance-Kurve ausblendet.

Ein erfundenes Konto startet mit 10.000 Geld. Es schließt in zwölf Schritten je einen Bruttogewinn von 100, während eine andere Position zeitweise einen offenen Verlust von 2.000 trägt. Die Zeilen zeigen den vollständigen künstlichen Verlauf, einschließlich des Startwerts.

Keine Ein-/Auszahlungen, keine Verzinsung und keine Marginrechnung. Die Kosten sind ein pauschaler Abzug pro geschlossenem Trade und sollen keine Brokergebühr nachbilden. Offenes P/L wird zusätzlich berücksichtigt, ohne die Kosten nochmals abzuziehen. Drawdown wird aus den angezeigten Modellzeitpunkten einschließlich Startwert berechnet; nicht beobachtete Zwischenbewegungen fehlen.

Dass dieselbe Strategie auch andere Kurven erzeugen könnte, zeigt dieses feste Beispiel nicht. Dafür wären weitere Pfade und überprüfbare Annahmen nötig. Das Labor demonstriert die Wirkung fehlender Information auf die Betrachtung eines gegebenen Verlaufs.

Kennzahlen richtig lesen.

KennzahlBerechnung / BedeutungTypischer Fehlschluss
TrefferquoteGewinnende geschlossene Trades / alle betrachteten geschlossenen Trades.Viele kleine Gewinne machen seltene große Verluste nicht unwichtig.
Profit FactorSumme positiver / Betrag der Summe negativer Trade-Ergebnisse.Ohne Verlusttrade ist der Quotient nicht endlich bestimmbar; keine Risikofreiheit.
Historischer ErwartungswertSumme der betrachteten Trade-Ergebnisse / Anzahl.Ein Stichprobenmittel ist nicht automatisch der Erwartungswert des nächsten Trades.
Equity-DrawdownRückgang von einem bisherigen Equity-Hoch zu einem späteren Wert.Der historische Maximalwert ist keine obere Grenze für künftige Verluste.
Sharpe RatioÜberschussrendite im Verhältnis zur Renditeschwankung; Frequenz und Berechnungsweise nennen.Ein hoher Wert garantiert weder Verlustfreiheit noch geringe Extremrisiken.
Exposure / HaltedauerGebundene Positionen und Dauer der Risikotragung.Eine Renditezahl allein zeigt nicht, welches Risiko dafür aufgenommen wurde.

Der MT5-Testreport definiert unter anderem Profit Factor, verschiedene Balance-/Equity-Drawdowns und Sharpe Ratio. Die konkreten Implementierungen und Bezugsgrößen sind beim Vergleich zu beachten. [4] Kennzahlen sollten netto, über vergleichbare Zeiträume und mit ausgewiesenen offenen Positionen betrachtet werden.

Einzahlungen sind kein Handelsgewinn. Bei wechselnden Kapitalzuflüssen unterscheiden sich einfache Kontowertveränderung, zeitgewichtete Rendite und geldgewichtete Rendite. Auch die Annualisierung kurzer Testperioden kann einen falschen Eindruck von Stabilität erzeugen. Eine exakt berechnete Zahl kann eine schwache Datengrundlage nicht verbessern.

Vom historischen Test zur prospektiven Beobachtung.

  1. In-Sample: Daten für Entwicklung und Parameterauswahl.
  2. Out-of-Sample: Daten, die diese Auswahl nicht beeinflusst haben. Nach Sichtung und Anpassung sind sie für die neue Version kein unberührter Test mehr.
  3. Walk-Forward: Wiederholt auf einem zurückliegenden Abschnitt kalibrieren und den jeweils folgenden Abschnitt nach festem Verfahren prüfen. Fenster, Auswahlkriterium und Anpassungsfrequenz vorab definieren.
  4. Prospektiver Demo-Forward: Version und Parameter vor Beginn festlegen; neue Daten erst im Verlauf beobachten. Technischer Betrieb wird sichtbar, reale Ausführung bleibt begrenzt abgebildet.
  5. Live-Beobachtung: Tatsächliche Transaktionen und Kosten vollständig dokumentieren. Ein Live-Konto beseitigt weder Kontenauswahl noch fehlende offene Verluste aus der Präsentation.

Begriffsgrenze in MT5: Der „Forward“-Bereich des Strategietesters ist ein späterer Teil des ausgewählten historischen Zeitraums. Er ist nicht automatisch ein erst künftig entstehender Live- oder Demozeitraum. Seine Unabhängigkeit hängt davon ab, ob er bereits in die Entwicklung eingeflossen ist. [1]

Keines dieser Verfahren liefert allein ein Gütesiegel. Für seltene Extremereignisse kann selbst eine lange profitable Phase wenig Beobachtungen enthalten. Viele eng zusammenhängende Trades sind nicht ebenso viele unabhängige Belege. Eine starre Mindestanzahl oder universelle Drawdown-Grenze wäre ohne Strategie- und Datenkontext irreführend.

Von Missverständnissen bis zur gezielten Irreführung.

BehauptungWas tatsächlich belegt wäreFehlende Prüfung
„Zehn Jahre profitabel.“Ein bestimmter historischer Test kann positiv sein.Regeln vorab oder nachträglich gewählt? Kosten vollständig?
„99 % Datenqualität.“Ein technischer Qualitätsindikator kann einen Datenaspekt beschreiben.Kein Nachweis einer 99-prozentigen Gewinnchance.
„KI erkennt das nächste Marktregime.“Ein Modell wurde unter bestimmten Datenbedingungen untersucht.Datenleck, Auswahlprozess, unabhängige Prognoseleistung.
„Maximal 8 % Drawdown.“Ein gemessener historischer Rückgang in einer bestimmten Serie.Keine feste Verlustobergrenze für spätere Pfade.
„Unabhängig verifiziert.“Ein Dritter hat einen ausdrücklich benannten Prüfbereich kontrolliert.Was genau: Herkunft, Berechnung, Vollständigkeit oder Kontozugriff?
„Forward bestätigt.“Eine weitere Testserie wurde ausgewertet.War sie vor Beginn unbekannt und unverändert?

Ein methodischer Fehler kann aus Unkenntnis entstehen. Eine verkürzte Präsentation kann fahrlässig sein. Werden erfolglose Varianten, offene Verluste oder unrealistische Annahmen bewusst verschwiegen, kann die Darstellung gezielt einen falschen Eindruck erzeugen. Die Absicht lässt sich aus der Kurve allein nicht feststellen. Kritisch geprüft werden deshalb überprüfbare Angaben und Auslassungen.

Als Beispiel für diese Unterscheidung behandelt die US-SEC Backtest-Ergebnisse im Kontext ihrer Regeln für Investment-Adviser-Marketing als hypothetische Performance. Ihre Materialien betonen die Bedeutung von Annahmen, Risiken und Grenzen. Das ist ein US-spezifischer Regelungszusammenhang und keine pauschale Rechtsaussage für jeden EA-Verkäufer in Europa. [5]

Der nächste sinnvolle Schritt: Nachweise anfordern.

Prüfcheckliste herunterladen (Markdown)

Bitten Sie Anbieter um das vollständige Testprotokoll, Strategieversion und Parameter, Datenquelle, sämtliche Kostenannahmen, den Auswahlprozess, alle offenen Positionen und eine nachvollziehbare unabhängige Testphase. Fragen Sie nach Änderungen zwischen Backtest und Live-Konto sowie nach vollständigen Transaktionsdaten statt ausschließlich Screenshots.

Entscheidungsregel: Ein fehlender Nachweis ist kein Betrugsbeweis. Er begrenzt aber, welche Schlussfolgerung Sie verantwortbar ziehen können. Ein spektakuläres Ergebnis ohne reproduzierbare Grundlage verdient weniger Vertrauen als eine bescheidenere, sauber dokumentierte Untersuchung.

TFF · Beobachtetes Verhalten

Die tatsächliche Handelsfolge untersuchen: Größen, Nachkäufe, Kosten, Haltedauer und offene Risiken. Datenechtheit und Vollständigkeit bleiben vorgelagerte Fragen.

Tradeflow Forensics ↗

ECS · Alternative Belastungen

Veränderte Reihenfolgen und Bedingungen betrachten. Das untersuchte Modell bestimmt die Aussagekraft; eine Simulation ist keine Validierung ihrer eigenen Annahmen.

Grid- und Margin-Labor

Die Verweise verbinden fachliche Prüfaufgaben; es wird keine implementierte Datenintegration behauptet. Ergänzend: Reports exportieren, Expert Advisors verstehen und Belege sichern und Verbraucher schützen.

Quellen und Aussagegrenzen.

Recherchestand 01.10.2026. Herstellerquellen erklären Testerfunktionen und Reportdefinitionen; die wissenschaftliche Arbeit untersucht Auswahlverzerrungen. Die kritische Einordnung und Rechenbeispiele sind unsere analytische Aufarbeitung. Die Lehrmodelle verwenden keine echten Marktdaten und bewerten kein konkretes Produkt.

  1. MetaTrader 5: Strategy Testing — Modi, Verzögerungen, Pip-Berechnung und historischer Forward-Bereich.
  2. MetaTrader 5: Real and Generated Ticks — Spread, Bid/Ask und Ersatz erzeugter Ticks.
  3. Bailey, Borwein, López de Prado und Zhu: The Probability of Backtest Overfitting — wissenschaftliche Methodik; das Auswahllabor implementiert deren PBO-Verfahren nicht.
  4. MetaTrader 5: Testing Report — Kennzahlen und Berechnungsgrenzen.
  5. SEC: Investment Adviser Marketing — US-spezifische Behandlung hypothetischer Performance.