Streszczenie
Iloraz wiarygodności, LR, porównuje dwie propozycje przez pytanie, jak prawdopodobne są obserwowane wyniki przy każdej z nich:
LR = P(wyniki | Hp, informacje) / P(wyniki | Hd, informacje)
LR większy od 1 wspiera propozycję w liczniku względem propozycji w mianowniku. LR równy 1 nie rozróżnia ich. LR mniejszy od 1 wspiera mianownik. Nie jest to prawdopodobieństwo, że osoba jest dawcą, i nie jest prawdopodobieństwem winy.
Błąd prokuratorski odwraca warunek. Z małego prawdopodobieństwa zgodnego profilu u losowej osoby wyciąga wniosek o małym prawdopodobieństwie niewinności albo niepochodzenia próbki od podejrzanego. To nie to samo. Do prawdopodobieństwa propozycji po wyniku potrzebne są szanse wcześniejsze oparte na innych dowodach i reguła Bayesa. Ekspert DNA dostarcza zwykle LR; sąd ocenia pozostałe informacje.
Wartość zależy od pary propozycji. „A kontra nieznana osoba niespokrewniona” może dać inny LR niż „A kontra brat A”. „DNA A jest w próbce” to inny poziom niż „A dotykała przedmiotu podczas czynu”. Nawet ogromny LR na poziomie źródła nie przechodzi automatycznie na poziom aktywności.
LR nie obejmuje z definicji każdego ryzyka pomyłki laboratoryjnej, złego pobrania, kontaminacji ani niepełnej wersji zdarzenia. Model powinien być zwalidowany, a raport ujawniać propozycje, assumptions, bazę populacyjną, conditioning, zakres danych i sensitivity analysis.

Dwie strony kreski warunkowej
Najważniejsza umiejętność to czytanie:
P(E | H)
jako:
prawdopodobieństwo wyników E, jeśli propozycja H jest prawdziwa.
To nie jest:
P(H | E)
czyli prawdopodobieństwo propozycji po zaobserwowaniu wyników.
Przykład pozagenetyczny: prawdopodobieństwo dodatniego testu przy chorobie może być wysokie, ale prawdopodobieństwo choroby po dodatnim teście zależy również od częstości choroby i false positives. W DNA analogicznie rarity profilu nie mówi samo, jakie były wcześniejsze szanse udziału osoby.
Propozycje i wyniki
Propozycja jest twierdzeniem o źródle lub czynności. Wynik jest obserwacją.
Poprawnie:
Hp: DNA w próbce pochodzi od A;Hd: DNA pochodzi od nieznanej osoby niespokrewnionej z A;E: profile próbki i A są zgodne w badanych loci.
Niepoprawnie:
Hp: zgodne DNA pochodzi od A;Hd: zgodne DNA pochodzi od nieznanej osoby.
Słowo „zgodne” wstawia wynik do obu propozycji. Wtedy prawdopodobieństwo zgodności jest 1 po obu stronach i LR traci sens.
ISFG zaleca formułowanie co najmniej dwóch propozycji, oddzielenie ich od obserwacji oraz ujawnienie assumptions i informacji kontekstowej.1
Propozycje nie muszą wyczerpywać świata
Para powinna być wzajemnie wykluczająca w rozważanym porównaniu, ale może istnieć trzecia możliwość poza parą. OSAC podkreśla, że LR może zostać obliczony nawet wtedy, gdy obie propozycje są fałszywe.2
Przykład:
Hp: A jest dawcą;Hd: nieznany niespokrewniony jest dawcą.
Rzeczywistym dawcą może być brat A. Wtedy obie są fałszywe w dosłownym sensie. LR nadal mówi, jak dane rozróżniają te dwa modele, lecz może nie odpowiadać realnemu sporowi.
Dlatego odbiorca musi widzieć mianownik.
Prostym profilem do LR
Załóżmy pełny profil pojedynczego źródła zgodny z A. W uproszczeniu:
P(E | Hp) ≈ 1
P(E | Hd) = częstość profilu w populacji odniesienia
LR ≈ 1 / częstość profilu
Jeśli częstość wynosi 1 na miliard:
LR ≈ 1 000 000 000
Interpretacja:
Obserwowany profil jest około miliard razy bardziej prawdopodobny, jeśli DNA pochodzi od A, niż jeśli pochodzi od losowej niespokrewnionej osoby z określonej populacji.
Nie:
Prawdopodobieństwo, że DNA nie pochodzi od A, wynosi jeden na miliard.
Random match probability i LR
RMP jest prawdopodobieństwem, że losowa osoba z populacji ma profil zgodny z dowodowym. W prostym pełnym profilu LR ≈ 1/RMP, jeśli licznik jest bliski 1 i assumptions odpowiadają.
W mieszaninie, dropout, drop-in i pokrewieństwie relacja nie jest tak prosta. LR uwzględnia prawdopodobieństwo całych danych pod oboma modelami. RMP opisuje wystąpienie profilu, nie mixture heights ani stochastic effects.
„Jeden na miliard” trzeba nazwać:
- częstością genotypu;
- RMP;
- probability of inclusion;
- LR;
- czymś innym.
Same cyfry nie są wymienne.
Błąd prokuratorski
Forma:
P(zgodność | A nie jest dawcą) = 1 / 1 000 000
zostaje błędnie przepisana jako:
P(A nie jest dawcą | zgodność) = 1 / 1 000 000
Pierwsze zdanie dotyczy wyniku przy założeniu. Drugie dotyczy założenia po wyniku. Do drugiego potrzebna jest liczba potencjalnych osób, sposób wskazania A, inne dowody i prior odds.
OSAC w zaleceniach dotyczących zeznań wskazuje transposition of the conditional i błąd prokuratorski jako niedopuszczalne przypisanie LR osobie zamiast wynikom.3
Błąd obrończy
Odwrotny błąd mówi: jeśli profil występuje u jednej osoby na milion, to w mieście dziesięciomilionowym jest dziesięć zgodnych osób, więc dowód ma małą wartość.
Problemy:
- oczekiwana liczba nie mówi, czy konkretne inne osoby mają profil;
- kandydat nie zawsze został wylosowany z całego miasta;
- inne dowody zmieniają prior odds;
- rzeczywista populacja kandydatów może być inna;
- LR nadal aktualizuje szanse.
Oczekiwanie dziesięciu profili w hipotetycznej populacji nie rozdziela ich identycznie w rzeczywistości i nie anuluje zgodności A.
Błąd unikalności
Stwierdzenie „profil jest unikalny” wykracza poza dane. Nie przetestowano wszystkich ludzi, bliźnięta jednojajowe mogą mieć ten sam standardowy profil, a częstość populacyjna nie jest dowodem absolutnej jedyności.
Można powiedzieć:
- profil jest rzadki w modelu populacyjnym;
- oczekiwana częstość wynosi;
- LR ma daną wartość przy propozycjach.
Nie ma potrzeby dodawać metafizycznej unikalności.
Bayes: gdzie trafia LR
Reguła w postaci szans:
posterior odds = prior odds × LR
Przykład:
prior odds = 1 : 1000
LR = 100
posterior odds = 1 : 10
Dowód DNA stukrotnie zwiększył szanse Hp względem Hd, ale nie uczynił Hp bardziej prawdopodobną niż Hd, bo start był bardzo niski.
Inny:
prior odds = 10 : 1
LR = 0.1
posterior odds = 1 : 1
DNA wspiera Hd i redukuje wcześniejszą przewagę.
Ekspert nie powinien arbitralnie wybierać prior odds, bo obejmują zeznania, nagrania, motyw i inne dowody należące do sądu.
LR jest aktualizatorem, nie werdyktem
LR mówi, przez jaki czynnik dane przesuwają względne wsparcie między dwiema propozycjami. Nie mówi:
- czy A jest winny;
- czy świadek mówi prawdę;
- czy przeszukanie było legalne;
- jaki jest standard dowodu;
- czy pozostałe dowody są wiarygodne.
Sąd łączy informacje, uważając na zależność. Jeśli prior odds już zawierają tę samą zgodność DNA z innego opisu, pomnożenie LR liczy dowód podwójnie.
Trzy różne liczby w jednym przypadku
W prostym przykładzie mogą pojawić się:
RMP = 1 / 100 000
LR = 100 000
posterior probability = zależna od prior odds
Jeśli prior odds wynoszą 1:1, posterior odds to 100 000:1, czyli posterior probability około 99,999%. Jeśli prior odds wynoszą 1:10 000 000, posterior odds to 1:100, czyli około 0,99%.
Ten sam LR może więc współistnieć z bardzo różnymi prawdopodobieństwami późniejszymi. Nie jest to wada LR. Dowód ma tę samą moc aktualizacji, ale sytuacja wyjściowa jest inna.
Ekspert powinien unikać nawet „intuicyjnego” prior. Wybór liczby kandydatów nie jest automatycznie prior, bo kandydaci nie mają równych szans po innych dowodach.
Bayes w postaci prawdopodobieństw
Jeśli rozważamy tylko Hp i Hd:
P(Hp | E) =
P(E | Hp) P(Hp)
--------------------------------------------
P(E | Hp) P(Hp) + P(E | Hd) P(Hd)
Wzór pokazuje brakujący składnik błędu prokuratorskiego: P(Hp) i P(Hd).
Jeśli istnieją inne propozycje, mianownik ma więcej składników. Sprowadzenie świata do dwóch możliwości może zawyżyć posterior, jeśli pominięto realistyczną trzecią.
Przykład diagnostyczny
Choroba występuje u 1 na 10 000 osób. Test ma 99% sensitivity i 1% false positive rate.
Na 1 000 000 osób:
- około 100 jest chorych, 99 ma wynik dodatni;
- około 999 900 jest zdrowych, 9 999 ma wynik dodatni.
Wśród dodatnich tylko około 99 z 10 098 jest chorych, czyli mniej niż 1%.
To nie jest model DNA, ale dobrze pokazuje conditional transposition. Wysokie P(positive|disease) nie daje wysokiego P(disease|positive) bez prevalence.
LR jako mnożnik na skali log
Przy bardzo dużych i małych liczbach używa się:
log10(LR)
Przykłady:
| LR | log10(LR) | Kierunek |
|---|---|---|
| 1 000 000 | 6 | Hp |
| 100 | 2 | Hp |
| 1 | 0 | neutralny |
| 0,01 | −2 | Hd |
| 0,000001 | −6 | Hd |
Logarytmy różnych niezależnych loci sumują się, bo likelihoods się mnożą. Znak pokazuje kierunek.
Zaokrąglenie log10 LR bywa przejrzyste w sensitivity analysis, ale odbiorca musi znać skalę.
Symetria odwrócenia propozycji
Jeśli zamienimy licznik z mianownikiem:
LR(Hd vs Hp) = 1 / LR(Hp vs Hd)
LR=1000 dla Hp odpowiada 0,001 po odwróceniu. Dowód nie staje się inny; zmienia się kierunek opisu.
Skala słowna powinna zachować tę symetrię. Nie można mieć bogatego słownika dla LR >1 i jednego słowa „brak wsparcia” dla LR <1.
Sub-source, source, activity i offence
Hierarchia:
| Poziom | Przykład propozycji |
|---|---|
| sub-source | DNA pochodzi od A vs nieznanej osoby |
| source | krew pochodzi od A vs nieznanej osoby |
| activity | A uderzyła B vs A udzielała B pomocy |
| offence | A popełniła zarzucany czyn vs nie |
Każdy poziom wymaga innych wyników i danych.
Profil STR daje bezpośrednio informację sub-source. Test krwi może wspierać source. Lokalizacja, transfer, persistence i recovery są potrzebne dla activity. Intencja i normy prawne nie są wyliczane przez DNA.
Najczęstszy błąd komunikacyjny to przedstawienie ogromnego sub-source LR jako prawdopodobieństwa activity.
„Czyje DNA?” i „jak się znalazło?”
Załóżmy, że DNA A na uchwycie ma LR 10^9 przeciw losowej osobie. A przyznaje, że używała przedmiotu wcześniej. Spór nie dotyczy już źródła, lecz czasu i czynności.
Powtarzanie 10^9 nie odpowiada na spór. Potrzebny jest activity LR:
P(lokalizacja, ilość, jakość | A użyła podczas czynu) /
P(lokalizacja, ilość, jakość | A użyła wcześniej)
Może być bliski 1, jeśli oba scenariusze przewidują profil.
Dobór mianownika
Mianownik określa pytanie:
- losowy niespokrewniony;
- brat;
- domownik;
- nieznany członek populacji;
- jeden z trzech partnerów;
- konkretny alternatywny użytkownik.
Im bardziej alternatywa genetycznie lub czynnościowo podobna do Hp, tym mniej wynik rozróżnia.
Nie wybiera się najsłabszego mianownika, aby LR był największy. Propozycje powinny odpowiadać wersjom stron lub realistycznemu zakresowi.
Alternatywa pokrewna
Brat A dzieli średnio więcej alleli niż niespokrewniony. Jeśli nie jest wykluczony okolicznościami, LR przeciw losowej osobie może nie odpowiadać sądowi.
Można raportować:
LR(A vs unrelated) = ...
LR(A vs brother) = ...
Nie są sprzeczne. Odpowiadają na dwa pytania.
W mieszaninie pokrewieństwo między nieznanymi dawcami też zmienia allele sharing i NOC.
Populacja odniesienia
Częstości alleli pochodzą z bazy próbek. Model uwzględnia:
- wielkość próby;
- definicję populacji;
- jakość genotypów;
- Hardy-Weinberg;
- linkage;
- strukturę populacji;
- rzadkie allele;
- uncertainty.
Profile nie mają częstości zapisanej w próżni. Dla kilku populacji można obliczyć zakres. Wybór najmniejszej po zobaczeniu wyniku jest bias.
Hardy-Weinberg
Dla locus z allelami a i b w uproszczonej populacji:
P(aa) = p_a²
P(ab) = 2 p_a p_b
To model random mating i odpowiednich warunków. Struktura, inbreeding i subpopulations zmieniają zależności.
W praktyce stosuje się korekty, np. theta, aby nie przeszacować rarity przez strukturę.
Korekta theta
W uproszczonym modelu Baldinga-Nicholsa dla homozygoty:
P(aa) = p_a [θ + (1−θ)p_a]
Dla heterozygoty:
P(ab) = 2 p_a p_b (1−θ)
θ reprezentuje współdzielenie pochodzenia wynikające ze struktury populacji. Dodatnia wartość zwiększa prawdopodobieństwo homozygot względem prostego p².
W konkretnych obliczeniach stosuje się pełne formuły i politykę laboratorium, zwłaszcza dla wielu nieznanych dawców. Ważna intuicja: im bardziej kandydat i rzeczywisty dawca mogą pochodzić z tej samej podpopulacji, tym ostrożniej z ekstremalną rarity.
Niepewność częstości
Jeśli allel zaobserwowano x razy w próbie n, x/n jest oszacowaniem, nie prawdą populacji. Rzadki allel może nie wystąpić w bazie mimo dodatniej częstości.
Stosuje się:
- minimal allele frequency;
- upper confidence bound;
- Bayesian smoothing;
- pooled rare allele;
- większą bazę.
Nie wolno użyć częstości zero. Wybór reguły wpływa na LR i powinien być zwalidowany.
Wielkość i jakość bazy
Duża baza nie jest automatycznie dobra, jeśli:
- ma duplikaty krewnych;
- błędy genotypów;
- niezgodną nomenklaturę;
- próbki convenience;
- nieznane pochodzenie;
- mieszane technologie;
- brak wersji.
Quality control populacyjnej bazy obejmuje Hardy-Weinberg, linkage, duplicate checks, allele calls i metadata.
Aktualizacja częstości może zmienić LR historyczny. Raport zachowuje wersję użytej bazy.
Product rule
Dla niezależnych loci:
P(profile) = Π P(genotype at locus i)
Niezależność wymaga biologicznej i populacyjnej podstawy. Loci sprzężone, X-STR, Y-STR i mtDNA mają inne modele.
W dużych panelach SNP linkage disequilibrium może wymagać bloków haplotypowych lub wyboru markerów.
Y-STR i mtDNA
Y-STR tworzą haplotyp linii ojcowskiej. mtDNA — matczynej. Nie mnoży się częstości loci Y jak autosomalnych niezależnych STR.
LR lub inna miara musi uwzględnić:
- database count;
- sampling uncertainty;
- mutation;
- genealogical clustering;
- krewnych;
- zakres haplotypu.
Zgodność linii nie jest zgodnością jednej osoby.
LR dla mieszaniny
Przykład:
Hp: mieszanina zawiera A, V i U;Hd: mieszanina zawiera V, U1 i U2.
Model sumuje po możliwych genotypach nieznanych i parametrach. Dane to nie tylko lista alleli, ale mogą obejmować wysokości, stutter i dropout.
LR = Σ likelihood(E | A,V,U,θ)P(U)
--------------------------------
Σ likelihood(E | V,U1,U2,θ)P(U1,U2)
Symboliczny zapis pokazuje, że LR nie jest „liczbą pasujących alleli”. Integruje niepewność.
Miniaturowy przykład locus
W locus obserwujemy allele 10,12,14. A ma 10,12. Zakładamy dwóch dawców, brak dropout i drop-in.
Pod Hp:
- A wnosi
10,12; - nieznany musi wnieść
12,14,10,14albo14,14zależnie od wysokości i pełnego modelu.
Pod Hd:
- dwie nieznane osoby muszą wspólnie wytworzyć
10,12,14; - istnieje więcej par genotypów.
Likelihood jest sumą częstości wszystkich zgodnych konfiguracji ważonych przez model pików. Sam fakt, że A „pasuje”, nie mówi, czy licznik przewyższa mianownik.
Dodanie heights może wzmocnić lub osłabić Hp. Jeśli 10 i 12 są bardzo niskie, a A miałby być major, model Hp pasuje źle.
LR dla dropout
Evidence ma tylko 10, kandydat 10,12.
Pod Hp potrzeba dropout 12. W uproszczeniu:
P(E | Hp) ∝ Pr(dropout 12)
Pod Hd nieznany 10,10 może dać wynik bez dropout, a 10,x z dropout. Mianownik sumuje możliwości.
Jeśli Pr(D)=0,01, Hp ponosi koszt. Jeśli profile innych loci pokazują bardzo niski minor, Pr(D) może być większe.
Nie można ustawić Pr(D)=1 tylko dlatego, że allele brakuje.
LR dla drop-in
Evidence ma dodatkowy słaby 14, a proponowani dawcy go nie mają.
Model może:
- użyć drop-in rate;
- dodać contributor;
- sklasyfikować artefakt;
- odrzucić profil.
Jeśli drop-in jest częsty w danych blank, jego obecność mniej odróżnia propozycje. Jeśli wymaga pełnego spójnego profilu, model jednego drop-in jest niewłaściwy.
Conditional LR i znany dawca
Przy mieszaninie V i nieznanego:
Hp: V + A
Hd: V + U
Conditioning na V oznacza, że jej genotyp jest wspólny. LR ocenia pozostałą informację.
Nie jest to:
profile evidence minus V = profile offender
Shared peaks pozostają sumą. Model uwzględnia wkład V w heights.
LR a combined probability of inclusion
CPI/RMNE pyta, jaka część populacji nie zostałaby wykluczona przez zestaw alleli. Nie formułuje pełnej pary propozycji i często nie wykorzystuje heights.
LR:
- może uwzględnić dropout;
- może być <1;
- porównuje kandydata z konkretną alternatywą;
- conditionuje znanych dawców;
- używa pełnego modelu.
W prostym profilu wyniki mogą być podobne. W complex mixture nie należy ich przedstawiać jako dwie nazwy tej samej liczby.
LR mniejszy od 1
LR 0.01 oznacza, że wyniki są 100 razy bardziej prawdopodobne przy Hd niż Hp.
To nie musi oznaczać formalnego wykluczenia. Kandydat może dzielić allele, ale wymaga mało prawdopodobnych dropoutów.
Raportowanie wyłącznie LR > 1 i nazywanie pozostałych „niekonkluzywnymi” tworzy asymetrię. Procedura powinna traktować wsparcie dla obu stron.
LR równy 1
LR = 1 oznacza brak zdolności rozróżnienia propozycji przez te dane. Nie oznacza:
- pół na pół;
- 50% winy;
- połowy profilu;
- błędu programu.
Może wynikać z bardzo słabego profilu albo z propozycji przewidujących te same wyniki, np. wcześniejsze i późniejsze legalne użycie.
LR nieskończony i zero
Matematyczne zero w mianowniku może dać infinity, a zero w liczniku LR = 0. W praktyce biologicznej dokładne zera są rzadkie i zależą od modelu.
Drop-in, mutation, contamination i error mogą sprawić, że „niemożliwe” jest tylko bardzo mało prawdopodobne. Program może raportować cap.
Ekstremalna liczba wymaga sprawdzenia:
- underflow;
- frequency floor;
- rare allele;
- dropout;
- convergence;
- propositions;
- validation range.
Wykluczenie a LR
Laboratorium może definiować exclusion przez regułę niezgodności albo próg LR. OSAC podaje, że termin i kryterium powinny być jawne.
LR bliski zero może wspierać wykluczenie, ale dropout i mutation model wpływają. Manual exclusion i probabilistic result muszą być spójne albo wyjaśnione.
Conditioning information
I w P(E | H,I) obejmuje informacje przyjęte jako znane:
- liczba dawców;
- profil osoby pokrzywdzonej;
- populacja;
- pokrewieństwo;
- typ materiału;
- lokalizacja;
- czas;
- aktywności.
To, co jest conditioning, nie jest oceniane przez LR. Jeśli conditionujemy na obecność V, wynik nie dowodzi V.
Lista assumptions powinna być w raporcie.
Conditioning na osobę pokrzywdzoną
Jeśli próbka pochodzi z ciała V, jej obecność może być wspólna dla obu propozycji. Wtedy model traktuje V jako known contributor.
Nie wolno conditionować na A tylko dlatego, że jest podejrzany. To założenie sporne.
Jeśli obecność V nie jest pewna, sensitivity bez conditioning może być potrzebne.
Wybór NOC
LR mieszaniny może silnie zależeć od 3 vs 4 contributors. NOC jest często modelem, nie obserwacją pewną.
Raport:
- podaje założenie;
- uzasadnia;
- sprawdza alternatywy;
- pokazuje, czy conclusion zmienia się.
Wybór NOC dającego największy LR jest niedopuszczalny.
Dropout, drop-in i stutter
Każde zjawisko ma prawdopodobieństwo w liczniku i mianowniku. Nie jest „karą obrony” ani „ratunkiem oskarżenia”.
Jeśli A wymaga pięciu dropoutów, Hp może mieć niskie prawdopodobieństwo. Jeśli losowa alternatywa wymaga jeszcze bardziej nietypowej konfiguracji, LR może nadal >1. Trzeba patrzeć na oba.
Model musi pochodzić z ground-truth validation.
Lab error nie jest zwykle w LR profilu
LR genetyczny często zakłada poprawną identyfikację próbki, kontrolowany proces i brak niewykrytej kontaminacji. Nie zawiera automatycznie:
- zamiany probówek;
- fałszu dokumentacji;
- błędu pobrania;
- nieznanej kontaminacji;
- błędu bazy;
- awarii software’u poza modelem.
Nie można interpretować LR = 10^12 jako probability of laboratory error 10^-12.
Quality system, proficiency tests, controls i error investigations są odrębną podstawą oceny.
Jak mówić o błędzie laboratoryjnym
Na pytanie „czy LR uwzględnia możliwość zamiany próbek?” odpowiedź powinna być jawna:
- model genotypowy zwykle zakłada prawidłową identyfikację;
- zamianę ograniczają chain of custody, barcodes, controls i review;
- laboratorium ma dane proficiency i nonconformities;
- konkretne odstępstwo wymaga osobnej oceny.
Nie należy dodawać nieudokumentowanej liczby P(lab error) do LR. Zdarzenia są zależne i źle zdefiniowane. Można jednak wykonać sensitivity scenariuszową, jeśli istnieją dane.
Prosecutor's fallacy z błędem procesu
Jeszcze groźniejszy skrót:
LR wynosi bilion, więc ryzyko jakiegokolwiek błędu wynosi jeden na bilion.
LR może być ogromny przy poprawnie zidentyfikowanym profilu, a probability sample swap niezależnie większe. Model opisuje wartość genetyczną warunkowo na procesie, nie total error probability.
Bliźnięta jednojajowe
Standardowe autosomalne STR nie rozróżniają zwykle bliźniąt monozygotycznych. Jeśli A ma bliźniaka B:
Hp: A;Hd: B;
profile likelihoods mogą być prawie identyczne, LR około 1. Rzadkość wspólnego profilu wobec populacji nie rozstrzyga A vs B.
Somatic mutations i ultra-deep sequencing mogą czasem znaleźć różnice, ale wymagają specjalnej walidacji i próbek tkanek. Nie zakłada się ich.
Chimerowość i przeszczep
Osoba po allogenicznym przeszczepie szpiku może mieć profil dawcy we krwi i mieszany profil w jamie ustnej. Jeśli reference blood jest użyty do śladu nabłonkowego, pozorna niezgodność ma medyczne wyjaśnienie.
LR jest poprawny dla podanych genotypów i assumptions, ale błędny reference profile prowadzi do złego pytania. Identity i tissue history są częścią procesu.
Database search i cold hit
Jeśli kandydat został znaleziony przez przeszukanie dużej bazy, proces selekcji może wpływać na interpretację.
Rozróżnić:
- target comparison osoby wskazanej niezależnie;
- database search spośród milionów;
- familial search;
- partial match;
- investigative genealogy.
Profil znaleziony w bazie potwierdza się na nowej próbce. Nie liczy się search hit i późniejszej zgodności jako dwóch niezależnych dowodów, jeśli pochodzą z tych samych loci.
Multiple testing i reguły bazy mogą wpływać na false hit expectation, ale LR poprawnie sformułowany nadal ocenia rarity. Trzeba ujawnić sposób wskazania osoby.
Selection bias
Jeśli po zobaczeniu profilu wybiera się:
- populację;
- NOC;
- loci;
- threshold;
- krewną alternatywę;
- model;
wynik może być tendencyjny. Case pre-assessment i sekwencyjne ujawnianie informacji ograniczają problem.
Zmiana jest dopuszczalna po nowym fakcie, ale powinna być zapisana, a alternatywy pokazane.
Data dredging w propozycjach
Jeśli istnieje wiele możliwych czynności, można znaleźć parę dającą duży activity LR. To odpowiednik wielokrotnego testowania.
Case assessment zapisuje:
- pierwotne wersje;
- informacje dostępne;
- zaplanowane wyniki;
- kryteria zmiany;
- dodatkowe propozycje.
Nie usuwa się propozycji niewygodnej po zobaczeniu danych. Można ją uznać za nieaktualną po nowym niezależnym dowodzie, ale historia pozostaje.
Propositions driven by the court
Ekspert pomaga sformułować testowalne wersje, ale nie powinien tworzyć Hd jako straw man. Obrona może przedstawić wersję. Jeśli jej nie ma, można użyć rozsądnej alternatywy, jawnie.
Propozycje powinny mieć podobny poziom szczegółowości. Porównanie bardzo konkretnego Hp z ogólnym „coś innego” jest asymetryczne.
Łączenie loci
Product rule łączy loci w jednym profilu. Jeśli loci są niezależne warunkowo, likelihoods mnożą się.
Nie należy jednak mnożyć:
- LR tego samego profilu policzonego dwoma programami;
- LR CE i MPS tych samych loci;
- hitu bazowego i potwierdzenia;
- kilku wymazów z tej samej depozycji bez modelu zależności.
To double counting.
Łączenie różnych dowodów
DNA, włókna, odciski i nagranie mogą być niezależne albo zależne. Ekspert jednej dyscypliny zwykle raportuje własny LR. Sąd ocenia całość.
Jeśli dwa badania korzystają z tej samej informacji o czynności, proste mnożenie może być błędne. Combined LR wymaga joint probability.
Sieć zależności
Przykład:
- DNA A na rękojeści;
- odcisk A na rękojeści;
- świadek widział A z przedmiotem.
DNA i odcisk mogą pochodzić z tego samego kontaktu, więc są zależne przy activity propositions. Świadek może mieć wiedzę o wyniku DNA z mediów, zwiększając zależność poznawczą.
Joint model pyta o prawdopodobieństwo zestawu, nie iloczyn marginesów:
P(DNA, fingerprint | H)
Jeśli conditional independence jest uzasadniona, można rozłożyć. Jeśli nie, mnożenie zawyża.
Dwa laboratoria, ten sam ekstrakt
Laboratorium 1 i 2 analizują aliquoty tego samego ekstraktu. Ich błędy instrumentów mogą być częściowo niezależne, ale:
- materiał;
- pobranie;
- ekstrakcja;
- kontaminacja wcześniejsza;
- chain of identity
są wspólne. Dwa zgodne profile nie są dwoma niezależnymi depozycjami.
Replikacja zwiększa zaufanie do analizy, lecz combined LR musi uwzględnić wspólną genezę.
Precyzja liczby
LR 3 847 293 118 sugeruje dokładność, której model nie ma. Źródła niepewności:
- sampling population;
- frequencies;
- parameters;
- MCMC;
- NOC;
- dropout;
- peak heights;
- model choice.
Zaokrąglenie do jednej–dwóch cyfr znaczących albo raportowanie rzędu wielkości może być uczciwsze.
Cap raportowy
Laboratorium może ustalić maksymalny raportowany LR, np. ze względu na population database lub validation. Wtedy:
LR ≥ cap
nie znaczy, że obliczony był dokładnie cap. Polityka musi być jawna. Cap nie naprawia modelu poza zakresem.
Underflow i obliczenia logarytmiczne
Prawdopodobieństwa wielu loci są bardzo małe. Bez logów komputer może zaokrąglić do zera. Pipeline używa log-likelihood:
log LR = log L(Hp) − log L(Hd)
Testy jednostkowe obejmują:
- znane przykłady;
- extreme values;
- rare alleles;
- symmetry;
- missing loci;
- reproducibility;
- precision.
Infinity może być artefaktem numerycznym, nie biologiczną niemożliwością.
Monte Carlo precision
Jeśli likelihood jest estymowany MCMC, LR ma Monte Carlo error. Uruchomienia z różnymi seed mogą dać różne ostatnie cyfry.
Laboratorium ustala:
- convergence diagnostics;
- minimal iterations;
- replicate policy;
- tolerated variance;
- rerun criteria;
- reporting precision.
Zaokrąglenie powinno być większe niż simulation noise.
Skale słowne
ENFSI dopuszcza mapowanie zakresów LR na określenia stopnia wsparcia, ale podkreśla, że LR=1 jest neutralny, >1 wspiera licznik, a <1 mianownik.4
Problemy:
- różne instytucje mają różne progi;
- słowa są mniej precyzyjne;
- odbiorcy nadinterpretują „silne”;
- skala może ukryć LR <1.
Najlepiej podać propozycje, liczbę lub zakres i zdefiniowany verbal equivalent.
Reporting 2025
SWGDAM opublikował w 2025 roku wytyczne raportowania LR i osobne wytyczne użycia probabilistic genotyping, uzupełniając standardy autosomalnych STR.5 To istotne, bo obliczenie i komunikacja są odrębnymi etapami.
Raport powinien zawierać:
- propozycje;
- wartość;
- kierunek wsparcia;
- assumptions;
- populację;
- software/model;
- ograniczenia;
- kryteria zaokrąglenia;
- sensitivity.
Formuła bezpiecznego zdania
Wyniki profilu DNA są około X razy bardziej prawdopodobne, jeśli [Hp], niż jeśli [Hd], przy założeniach [I].
Zdanie wiąże liczbę z wynikami, nie prawdopodobieństwem osoby. OSAC zaleca taki sposób i przypomina, że LR nie rozstrzyga prawdziwości propozycji.
Pełny przykład raportu
Z próbki S1 uzyskano mieszaninę DNA co najmniej trzech osób. Do obliczenia przyjęto trzy osoby, a profil V potraktowano jako znanego dawcę, ponieważ próbkę pobrano z jej ciała. Porównano propozycje: (Hp) mieszanina zawiera DNA V, A i jednej nieznanej osoby niespokrewnionej; (Hd) mieszanina zawiera DNA V i dwóch nieznanych osób niespokrewnionych z A oraz wzajemnie. Wyniki są około 2 miliony razy bardziej prawdopodobne przy Hp niż przy Hd. Obliczenie używało [software/version], bazy [version] i korekty [theta]. Przy modelu czterech dawców LR pozostawał w tym samym zdefiniowanym zakresie słownym. Wynik nie określa, kiedy ani przez jaką czynność DNA A znalazło się w próbce.
Ten akapit zawiera:
- próbkę;
- NOC;
- conditioning;
- propozycje;
- LR;
- model;
- sensitivity;
- poziom wnioskowania.
Nie podaje posterior probability.
Przykład raportu dla LR <1
Porównano propozycje: (Hp) A jest jednym z dwóch dawców oraz (Hd) dwie nieznane osoby są dawcami. Wyniki są około 25 razy bardziej prawdopodobne przy Hd niż przy Hp (
LR=0,04). Zatem wyniki wspierają Hd względem Hp.
Nie należy pisać tylko „wynik niewspierający”. Kierunek jest częścią informacji.
Pytania kontrolne na rozprawie
Czy LR to szansa, że oskarżony jest dawcą?
Nie. To stosunek prawdopodobieństwa wyników przy dwóch propozycjach.
Skąd wiadomo, że Hd jest prawidłowa?
LR nie potwierdza propozycji; porównuje ją z Hp. Inna Hd da inny wynik.
Czy ktoś inny może mieć profil?
Tak. Częstości opisują, jak często oczekuje się zgodnego genotypu; standardowe STR nie zapewniają absolutnej unikalności.
Czy LR uwzględnia pomyłkę probówki?
Zwykle nie w modelu genotypowym. Ryzyko kontroluje system jakości i ocenia się osobno.
Dlaczego nie podano prawdopodobieństwa winy?
Wymagałoby oceny wszystkich dowodów i prior odds, co należy do sądu.
Co jeśli dawcą jest brat?
Można obliczyć alternatywny LR z bratem w mianowniku; należy to zrobić, jeśli wersja jest realna.
Nauczanie na macierzy 2×2
Pomocna macierz:
| Hp prawdziwa | Hd prawdziwa | |
|---|---|---|
| wynik E | P(E|Hp) |
P(E|Hd) |
| brak E | 1−P(E|Hp) |
1−P(E|Hd) |
LR porównuje elementy jednego wiersza. Nie porównuje kolumn posterior bez prior.
W activity-level E może być pakietem: lokalizacja, ilość, profil. Wtedy probabilities dotyczą całego pakietu.
Analiza wrażliwości jako tabela
| Założenie | LR |
|---|---|
| 3 contributors, unrelated | 2×10^6 |
| 4 contributors, unrelated | 4×10^5 |
| 3 contributors, brother alternative | 3×10^3 |
| wyższy drop-in rate | 8×10^5 |
Tabela nie pokazuje „właściwej” liczby, lecz wpływ assumptions. Jeśli wszystkie wspierają ten sam kierunek i zakres, conclusion jest robust. Jeśli przechodzą przez 1, wynik jest model-sensitive.
Walidacja LR
Walidacja obejmuje:
- poprawność matematyczną;
- znane ręczne przykłady;
- true contributors;
- non-contributors;
- mixtures;
- dropout/drop-in;
- related alternatives;
- rare alleles;
- NOC;
- convergence;
- regression tests;
- reporting.
Software może poprawnie liczyć wzór, ale źle importować allele albo przypisywać population database. Waliduje się end-to-end.
Audit trail obliczenia
Rekord powinien zawierać:
- evidence data i preprocessing;
- reference profiles;
- propositions;
- conditioning;
- NOC;
- population;
- theta;
- software/version;
- parameters;
- seed;
- run logs;
- LR per locus;
- overall LR;
- sensitivity;
- review;
- exact wording.
LR per locus pomaga wykryć locus dominujące, błąd danych i niezwykłą niezgodność. Nie raportuje się selektywnie tylko korzystnych loci.
Independence loci a suma log LR
Wykres per-locus log LR może pokazać:
- większość loci wspiera Hp;
- kilka jest neutralnych;
- jedno silnie wspiera Hd przez dropout.
Overall jest sumą, jeśli model independence jest właściwy. Locus o skrajnym wkładzie wymaga kontroli rare allele, null allele i artifact.
Nie usuwa się go bez predefiniowanej reguły.
Granica roli eksperta
Ekspert może powiedzieć:
- co zmierzono;
- jak działa model;
- jakie assumptions;
- jaki LR;
- jakie limitation.
Nie powinien powiedzieć:
- jaką prior probability ma przyjąć sąd;
- czy świadek jest wiarygodny;
- czy A jest winny;
- czy jedna propozycja została „udowodniona”.
Ta granica chroni zarówno naukę, jak i decyzję prawną.
Niebezpieczne zdania
„Prawdopodobieństwo, że DNA należy do kogoś innego, wynosi 1/X.”
Odwrócenie warunku.
„Istnieje X do 1 szans, że A jest dawcą.”
Posterior odds bez prior.
„Tylko jedna na X osób może być dawcą.”
Rarity profilu nie jest listą potencjalnych dawców.
„DNA identyfikuje A z pewnością.”
Ignoruje model, bliźnięta, błędy i poziom aktywności.
„LR X dowodzi, że A dotykała przedmiotu.”
Jeśli LR jest sub-source, nie ocenia transferu.
LR i zeznanie ustne
Ekspert powinien umieć:
- nazwać propozycje bez skrótu;
- wyjaśnić kreskę warunkową;
- podać znaczenie LR >1, =1, <1;
- odróżnić RMP;
- omówić population database;
- wskazać assumptions;
- wyjaśnić related alternative;
- powiedzieć, czego LR nie obejmuje;
- rozpoznać błąd prokuratorski w pytaniu.
Na pytanie „czyli jaka jest szansa, że A nie jest dawcą?” odpowiedź: LR sam jej nie określa.
Studium 1: profil jeden na milion
Profil ma RMP 1/1 000 000. A został wskazany przez świadka przed badaniem.
Poprawnie: zgodność jest około milion razy bardziej prawdopodobna, jeśli A jest dawcą, niż jeśli losowy niespokrewniony.
Niepoprawnie: milion do jednego, że A jest dawcą.
Świadek wpływa na prior odds, nie na RMP.
Studium 2: baza miliona osób
Profil o RMP 1/1 000 000 trafia jedną osobę w bazie miliona.
Nie wynika, że hit ma tylko 50% wartości. Oczekiwanie jednego przypadkowego profilu nie jest posterior probability. Trzeba uwzględnić search process, jakość profilu, potwierdzenie, liczbę przeszukanych rekordów i inne dowody.
Hit nie staje się niezależny od profilu, który go wygenerował.
Studium 3: brat
A i B są braćmi. LR A vs unrelated wynosi 10^8, A vs B 50.
Obie liczby mogą być poprawne. Jeśli B jest realnym kandydatem, 50 jest ważniejsze dla tego sporu. Raportowanie tylko 10^8 odpowiada na łatwiejsze pytanie.
Studium 4: LR poniżej 1
Mieszanina ma część alleli A, ale model Hp wymaga wielu dropoutów. LR=0.02.
Wyniki są 50 razy bardziej prawdopodobne przy Hd niż Hp. Jakościowe „A nie można wykluczyć” byłoby mylące bez wagi.
Studium 5: zgodne źródło, nierozstrzygająca czynność
DNA A na wspólnym narzędziu ma sub-source LR 10^12. A jest właścicielem i używa narzędzia codziennie.
Propozycje activity:
- A użyła go podczas czynu;
- A używała wcześniej, a podczas czynu użył go B.
Oba przewidują DNA A. Activity LR może być bliski 1. Miliardowa rzadkość nie datuje materiału.
Studium 6: dwa wymazy
Dwa sąsiednie wymazy dają LR 10^6 i 10^5 dla A. Nie wolno automatycznie mnożyć do 10^11.
Próbki mogą pochodzić z jednej depozycji, wspólnego transferu albo cross-contamination. Potrzebny joint model albo wybór właściwej jednostki.
Studium 7: obie propozycje fałszywe
Model porównuje A z niespokrewnionym U, ale rzeczywistym dawcą jest jednojajowy bliźniak A. Profil standardowych STR pasuje jak A.
LR może silnie wspierać Hp względem Hd, choć A nie jest dawcą. To pokazuje, że LR nie potwierdza prawdziwości propozycji, tylko porównuje predictions.
Najczęstsze błędy
Odwrócenie warunku. P(E|H) nie jest P(H|E).
LR jako posterior. Brakuje prior odds.
RMP jako error rate. Nie obejmuje procesu.
Brak mianownika. Liczba bez alternatywy nie ma znaczenia.
Losowy niespokrewniony przy realnym bracie. Zła propozycja.
Sub-source jako activity. Zgodność nie wyjaśnia drogi.
LR=1 jako 50%. To neutralność danych.
LR<1 jako „niekonkluzywny”. Może wspierać Hd.
Nieskończony LR jako pewność. Zwykle granica modelu.
Mnożenie zależnych dowodów. Double counting.
Database hit plus confirmation. Te same loci.
Zbyt wiele cyfr. Pozorna precyzja.
Skala słowna bez definicji. Ukrywa zakres.
Lista kontrolna LR
- Jakie są dokładne
HpiHd? - Czy są na tym samym poziomie hierarchii?
- Czy odpowiadają realnemu sporowi?
- Jakie wyniki stanowią
E? - Co jest conditioning
I? - Jaka populacja i baza?
- Czy pokrewieństwo jest realne?
- Jaki NOC?
- Jak modelowano dropout, drop-in i stutter?
- Czy model jest zwalidowany?
- Czy wynik jest wrażliwy na assumptions?
- Czy inne dowody są niezależne?
- Czy liczba jest odpowiednio zaokrąglona?
- Czy zdanie unika transposition?
- Czy raport mówi, czego LR nie obejmuje?
Co zapamiętać
- LR porównuje prawdopodobieństwo wyników przy dwóch propozycjach.
- Nie jest prawdopodobieństwem propozycji ani winy.
- Błąd prokuratorski zamienia
P(E|H)naP(H|E). - Posterior odds wymagają prior odds i LR.
- Mianownik decyduje o pytaniu.
- Alternatywa pokrewna może dać zupełnie inny LR.
- LR sub-source nie jest LR activity.
- LR <1 wspiera mianownik, LR=1 jest neutralny.
- Genetyczny LR nie jest laboratoryjną error rate.
- Poprawny raport wiąże liczbę z wynikami, propozycjami i assumptions.