Erstellung von 50 Bewertungsfragen, die die Produktionsqualität vorhersagen
Teams, die messen, neigen dazu, die einfachen Fälle zu messen, weil dort bereits jemand die Antwort kennt. Die Fragen, die Ihnen Geld kosten werden, sind die, die niemand berücksichtigt hat.
Was passiert ist
Ein Team erstellt einen Evaluierungssatz von fünfzig Fragen, erzielt gute Ergebnisse, bringt ihn auf den Markt und beobachtet dann, wie die Benutzerzufriedenheit über zwei Monate hinweg sinkt, ohne dass sich ein einzelner Metrik ändert. Der Satz war nicht falsch, sondern eher nicht repräsentativ. Er hat die Fragen abgebildet, auf die die Ersteller bereits die Antworten kannten, die per Konstruktion diejenigen sind, die das System am besten bewältigt.
Warum es für Bereitstellungsteams wichtig ist
Ein Evaluierungssatz ist ein statistisches Instrument, und seine einzige Aufgabe ist es, das Verhalten auf nicht gesehenen Daten vorherzusagen. Ein Satz, der auf der Vorstellungskraft des Teams basiert, wird die Qualität auf genau den Dimensionen überschätzen, die das Team versteht, und schweigen über diejenigen, die es nicht tut: Fachjargon, fehlerhafte Abfragen, Fragen, die zwei Dokumente umfassen, und Fragen, die der Korpus überhaupt nicht beantworten kann.
Wie man ihn aufbaut
Beziehen Sie sich aus der Realität, wo immer möglich - Support-Tickets, Suchprotokolle, die Fragen, die der Vertrieb gestellt werden. Wo dies nicht möglich ist, lassen Sie jemanden, der den Job täglich ausführt, sie schreiben, und nicht die Person, die das System erstellt hat. Dann erzwingen Sie eine Zusammensetzung. Ungefähr vierzig sollten beantwortbar sein, über Schwierigkeitsgrade hinweg ausgewählt. Fünf müssen aus dem Korpus nicht beantwortbar sein, um zu testen, ob das System ablehnt, anstatt zu erfinden. Fünf sollten ein überzeugendes Ablenkungsdokument haben, das relevant erscheint und es nicht ist.
Wie man ihn ehrlich hält
Erneuern Sie den Satz quartalsweise und lassen Sie das Modell ihn während der Entwicklung nie sehen, oder Sie werden ihn anpassen. Protokollieren Sie eine Stichprobe von Live-Abfragen jede Woche und überprüfen Sie, ob sie Ihrem Satz ähneln; wenn sie nicht mehr ähneln, ist der Satz abgelaufen. Und behandeln Sie eine Regression von mehr als fünf Punkten bei Kontextabruf als Build-Fehler, weil eine Metrik, die niemand durchsetzt, eine Metrik ist, die in der Woche vor einem Deadline ignoriert wird.