Streszczenie

Fenotypowanie DNA nie odtwarza fotografii nieznanej osoby. Z określonych wariantów przewiduje prawdopodobieństwa ograniczonej listy cech, na przykład kategorii koloru oczu, włosów i skóry. Inne modele szacują biogeograficzne pochodzenie albo wiek z metylacji, lecz każdy ma własną populację treningową, macierz błędów i zakres materiałów.

Genealogia śledcza działa inaczej. Gęsty profil SNP nie musi wskazać bliskiego krewnego. Wystarczy kilku dalszych matches, wspólne segmenty IBD, drzewa genealogiczne oraz dokumenty, aby zbudować listę potomków wspólnych przodków. Następnie filtruje się ją wiekiem, płcią, miejscem i informacją śledczą.

Obie metody generują leads. Nie identyfikują sprawcy i nie zastępują dowodu. Kandydat z genealogii powinien zostać potwierdzony nową, legalnie pozyskaną próbką i zwykłym porównaniem kryminalistycznym. Fenotyp służy do zawężenia poszukiwań, a nie do przeszukiwania ludzi o „podobnym wyglądzie” bez kontroli błędu.

Największe ryzyka dotyczą błędnego modelu, mieszanin, imputation, błędów drzew, endogamii, nadinterpretacji pochodzenia jako „rasy”, naruszenia preferencji użytkowników bazy oraz ujawnienia relacji żyjących osób. Prawidłowy workflow wymaga podstawy prawnej, ograniczenia do uprawnionych spraw, minimalizacji danych, audytu i jasnego końca retencji.

Dwa odrębne tory tworzenia leadów z DNA: fenotypowanie przewiduje prawdopodobieństwa cech i pochodzenia, a genealogia śledcza prowadzi od gęstego profilu SNP przez segmenty IBD i drzewa do kandydatów; oba tory wymagają niezależnego potwierdzenia standardowym profilem DNA.
Dwa odrębne tory tworzenia leadów z DNA: fenotypowanie przewiduje prawdopodobieństwa cech i pochodzenia, a genealogia śledcza prowadzi od gęstego profilu SNP przez segmenty IBD i drzewa do kandydatów; oba tory wymagają niezależnego potwierdzenia standardowym profilem DNA.

Dwa narzędzia, jeden częsty błąd

Fenotypowanie odpowiada:

Jakie obserwowalne cechy są bardziej lub mniej prawdopodobne przy tym genotypie?

Genealogia odpowiada:

Z jakimi użytkownikami bazy ten profil dzieli segmenty i przez jakich wspólnych przodków może być z nimi spokrewniony?

Oba wyniki bywają przedstawiane jako „wskazanie osoby z DNA”. To skrót wprowadzający w błąd. W pierwszym przypadku powstaje probabilistyczny opis cech. W drugim — hipoteza o położeniu osoby w sieci rodzinnej.

Profil identyfikacyjny, fenotypowy i genealogiczny

Te trzy produkty mają inne konstrukcje:

Produkt Typowa informacja Cel
profil STR kilkanaście–kilkadziesiąt bardzo zmiennych loci porównanie osoby lub bliskiego pokrewieństwa
panel fenotypowy dziesiątki–setki wybranych SNP/CpG predykcja cech, pochodzenia albo wieku
profil genealogiczny setki tysięcy SNP genomowych wykrycie dzielonych segmentów i dalszych krewnych

Nie wystarczy „przekonwertować STR do SNP”. Profile mierzą inne loci. Z tego samego ekstraktu można wytworzyć różne produkty, ale każdy wymaga osobnej walidacji i decyzji o zakresie użycia.

Fenotyp jest rozkładem

Dla koloru oczu model może zwrócić:

niebieskie      0,72
pośrednie       0,08
brązowe         0,20

To nie jest obserwacja oka. To wynik klasyfikatora dla zdefiniowanych kategorii.

Decyzja zależy od reguły:

  • wybierz najwyższe prawdopodobieństwo;
  • nazwij kategorię tylko powyżej progu;
  • przy zbyt płaskim rozkładzie raportuj „nieokreślone”;
  • pokaż wszystkie wartości.

Dwa laboratoria mogą mieć ten sam wektor i inny komunikat, jeśli użyją innych reguł.

Ground truth cechy

Model uczy się na osobach, którym przypisano etykietę, na przykład „włosy blond”. Etykieta sama ma niepewność:

  • światło zmienia fotografię;
  • włosy są farbowane;
  • kategorie są kulturowe;
  • kolor włosów ciemnieje z wiekiem;
  • opalenizna zmienia skórę;
  • heterochromia nie mieści się w jednej klasie;
  • obserwatorzy różnią się.

Błąd ground truth ogranicza model, nawet gdy genotyp jest idealny.

Kolor oczu

Pigmentacja tęczówki zależy silnie od regionu HERC2/OCA2, ale nie od jednego „genu niebieskich oczu”. Wiele wariantów modyfikuje ilość i rozmieszczenie melaniny.

Modele zwykle dobrze rozdzielają skrajne brązowe i niebieskie oczy w populacjach podobnych do treningowych. Kategoria pośrednia jest trudniejsza, bo obejmuje zielone, piwne, szare i mieszane fenotypy.

HIrisPlex przeszedł developmental validation dla predykcji oka i włosów, w tym badania czułości, materiałów casework, degradacji i zgodności między laboratoriami.1

Kolor włosów

Model może raportować:

  • blond;
  • brązowe;
  • czarne;
  • rude;
  • jasny/ciemny odcień.

Włosy dziecięce i dorosłe mogą się różnić. Siwienie, farbowanie, łysienie i zaburzenia pigmentacji nie wynikają bezpośrednio z typowego modelu.

Predykcja genetycznej pigmentacji nie mówi, jak osoba wyglądała w dniu zdarzenia.

Kolor skóry

Pigmentacja skóry jest cechą ciągłą zależną od wielu loci, ekspozycji UV, wieku i stanu fizjologicznego. Kategorie „pale/intermediate/dark” upraszczają gradient.

Największe ryzyka:

  • niedoreprezentowane populacje;
  • admixed individuals;
  • mylenie pigmentacji z pochodzeniem;
  • różne skale fotografii;
  • przesunięcie między training a case population.

Raport powinien pokazywać prawdopodobieństwa i znaną performance dla odpowiednich grup, nie syntetyczną etykietę „rasy”.

Inne cechy wyglądu

Badania obejmują:

  • piegi;
  • łysienie androgenowe;
  • morfologię włosa;
  • cechy twarzy;
  • wzrost;
  • BMI;
  • siwienie.

Wiele z nich ma mniejszą przewidywalność niż pigmentacja. Wzrost i twarz są silnie poligeniczne oraz zależne od środowiska. Model może przewidzieć część wariancji populacyjnej, lecz nie wygeneruje geometrii konkretnej twarzy.

„Portret z DNA”

Obraz twarzy w raporcie może łączyć:

  • przewidywaną pigmentację;
  • statystyczną morfologię;
  • założony wiek;
  • płeć;
  • fryzurę;
  • artystyczne wypełnienie braków.

Widz nie potrafi oddzielić informacji genetycznej od decyzji grafika. Fotorealistyczna forma tworzy pozorną precyzję.

Jeżeli wizualizacja jest używana, powinna:

  • wskazać cechy przewidziane;
  • oznaczyć elementy neutralne lub założone;
  • pokazać alternatywy;
  • podać zakres wieku;
  • nie zawierać przypadkowych cech rozpoznawczych;
  • mieć ostrzeżenie, że nie jest podobizną.

Pochodzenie biogeograficzne

Ancestry-informative markers mają różne częstości w populacjach referencyjnych. Model porównuje profil z klastrami.

Możliwy wynik:

większe wsparcie dla modelu mieszanego
Europa północno-wschodnia + Azja wschodnia
niż dla pojedynczych grup referencyjnych

To nie:

  • narodowość;
  • obywatelstwo;
  • język;
  • kultura;
  • rasa;
  • miejsce urodzenia;
  • jednoznaczne pochodzenie każdego przodka.

Granice klastrów zależą od próbek referencyjnych i algorytmu.

Admixture

Osoba może mieć przodków z kilku regionów. Global ancestry szacuje uśrednione proporcje, local ancestry przypisuje segmenty do źródeł.

Problemy:

  • podobne populacje źródłowe;
  • niewłaściwa liczba klastrów;
  • niedawna lub dawna domieszka;
  • nierówne reference panels;
  • linkage disequilibrium;
  • batch effects.

Wynik 30% nie oznacza dokładnie „trzech z dziesięciu przodków”. Rekombinacja daje losowy udział.

Pochodzenie nie jest identyfikatorem

Miliony osób mogą mieć podobny ancestry profile. Jego rola jest śledcza:

  • ukierunkować poszukiwanie AM;
  • pomóc w identyfikacji nieznanych szczątków;
  • wybrać populację do dalszych analiz;
  • kontrolować zgodność innego leada.

Nie powinien uzasadniać masowego typowania grup etnicznych ani traktowania przynależności jako podejrzenia.

Narzędzia wielocechowe

VISAGE Enhanced Tool łączy setki SNP dla kilku cech wyglądu i biogeograficznego pochodzenia w jednym assay, a jego rozwój obejmował badanie międzylaboratoryjne oraz próbki trudne.2

„Jeden assay” nie oznacza jednego poziomu performance. Każda cecha ma:

  • osobny model;
  • osobne dane treningowe;
  • własne klasy;
  • inną macierz błędów;
  • odrębne ograniczenia populacyjne.

Wiek epigenetyczny

Wiek można szacować z metylacji CpG. Zmiany epigenetyczne korelują z wiekiem chronologicznym, ale nie są zegarem z datą urodzenia.

Model zwraca na przykład:

oszacowanie: 42 lata
średni błąd absolutny w walidacji: 4,8 roku
przedział predykcji: 32–52 lata

Właściwy komunikat obejmuje przedział, nie tylko 42.

Tkanka ma znaczenie dla wieku

Metylacja jest tissue-specific. Model dla krwi może nie działać dla:

  • nasienia;
  • śliny;
  • kości;
  • zęba;
  • mieszanki tkanek.

Wiek dawcy, wiek śladu i czas od depozycji to trzy różne rzeczy. Model wieku dawcy nie datuje plamy.

VISAGE opracowało osobne narzędzia i modele dla tkanek somatycznych oraz nasienia, co pokazuje, że platforma i biomateriał są częścią definicji modelu.3

Choroba i styl życia

Metylację mogą zmieniać:

  • palenie;
  • choroba;
  • leki;
  • stres;
  • skład komórek;
  • ciąża;
  • środowisko.

Nie każda zmiana stanowi błąd: biologiczny wiek może rzeczywiście różnić się od chronologicznego. W kryminalistyce pytanie dotyczy zwykle tego drugiego, więc confounding musi być zbadany.

Sex inference

Markery chromosomów X/Y mogą wskazać skład chromosomowy próbki, lecz nie zawsze odpowiada on:

  • tożsamości płciowej;
  • fenotypowi;
  • zapisowi prawnemu;
  • wyglądowi.

Wyjątki obejmują:

  • warianty liczby chromosomów;
  • translokacje;
  • chimeryzm;
  • przeszczep;
  • mieszaninę;
  • dropout Y.

Raport powinien opisywać markerowy wynik bez rozszerzania go poza dane.

Performance modelu

Accuracy ogólna może mylić. Jeśli 90% populacji ma brązowe oczy, model zawsze mówiący „brązowe” ma 90% accuracy, ale nie rozpoznaje innych kategorii.

Potrzebne są:

  • sensitivity;
  • specificity;
  • precision;
  • negative predictive value;
  • ROC/AUC;
  • calibration;
  • confusion matrix;
  • coverage kategorii nieokreślonej;
  • performance per population.

Predictive value zależy od prevalence. Wynik z publikacji nie przenosi się automatycznie na inną populację śledczą.

Calibration predykcji

Jeśli spośród przypadków z raportem 0,8 dla niebieskich oczu około 80% rzeczywiście ma niebieskie oczy, model jest dobrze skalibrowany dla tego zbioru.

Model może dobrze rozróżniać kolejność osób, ale być nadmiernie pewny. Dlatego sama AUC nie wystarcza.

Jak powstaje wynik klasyfikatora

W prostym modelu regresji logistycznej każdy genotyp wnosi współczynnik:

logit(P(cecha)) = β0 + β1·SNP1 + β2·SNP2 + ... + βn·SNPn

Genotyp może być kodowany jako liczba alleli efektowych 0/1/2, a później funkcja logistyczna przekształca sumę na wartość od 0 do 1. W klasyfikacji wieloklasowej oblicza się kilka score i normalizuje je, na przykład softmax.

W bardziej złożonych modelach występują:

  • interakcje wariantów;
  • haplotypy;
  • random forest;
  • gradient boosting;
  • sieci;
  • polygenic scores;
  • modele hierarchiczne dla populacji.

Większa złożoność może uchwycić nieliniowość, ale utrudnia wyjaśnienie i zwiększa ryzyko overfitting. Kryminalistyczna walidacja bada produkt wraz z wersją modelu, a nie tylko panel markerów.

Próg zmienia rodzaj błędu

Jeżeli celem jest opublikowanie leada o rudych włosach, próg można ustawić wysoko, aby zmniejszyć false positive. Wtedy część rzeczywiście rudowłosych nie zostanie opisana.

próg wyższy → większa swoistość, mniejsza czułość
próg niższy → większa czułość, więcej fałszywych wskazań

Regułę ustala się przed sprawą i zgodnie z zastosowaniem. Nie obniża się jej dlatego, że śledczy „potrzebuje czegokolwiek”. Kategoria inconclusive jest prawidłowym wynikiem.

Niepewność genotypu w predykcji

W idealnym panelu każdy SNP jest znany. W materiale forensic mamy genotype likelihood:

P(AA | reads) = 0,70
P(AB | reads) = 0,29
P(BB | reads) = 0,01

Poprawny model może uśrednić wynik cechy po tych możliwościach. Wstawienie twardego AA ignoruje 30% niepewności.

Niepewność ma kilka warstw:

  • pomiar odczytów;
  • imputowany genotyp;
  • współczynniki modelu;
  • dataset shift;
  • niejednoznaczna etykieta fenotypu;
  • zmienność środowiskowa.

Podanie jednej liczby bez opisania dominującej warstwy tworzy złudzenie precyzji.

Równość działania nie wynika z jednego wyniku

Model może mieć tę samą accuracy ogólną, ale różne błędy między grupami. Jeśli słabiej przewiduje pośrednie pigmentacje albo osoby admixed, jego leady częściej będą:

  • fałszywie zawężać;
  • pozostawać nieokreślone;
  • kierować poszukiwanie ku kategorii większościowej.

Ocena obejmuje performance per group i liczebność każdej grupy. Mały przedział ufności dla populacji dominującej nie kompensuje braku danych dla innej.

To nie oznacza, że każdy model musi działać identycznie biologicznie. Oznacza, że różnice należy zmierzyć, zakomunikować i uwzględnić w decyzji o użyciu.

Training, validation i test

Dane dzieli się na:

  • trening;
  • dobór parametrów;
  • wewnętrzną walidację;
  • zewnętrzny test;
  • późniejszy monitoring casework.

Wielokrotne poprawianie modelu na tym samym zbiorze testowym prowadzi do leakage. „Niezależny” zbiór nie jest niezależny, jeśli te same osoby albo bliscy krewni występują w treningu.

Dataset shift

Model może działać gorzej, gdy zmienia się:

  • populacja;
  • platforma;
  • jakość DNA;
  • proporcja kategorii;
  • sposób etykietowania cechy;
  • laboratorium;
  • pipeline;
  • imputation panel.

Nie wystarczy podać historycznej accuracy. Lokalna walidacja ocenia pełen tor.

Mieszanina

Fenotypowanie zwykle zakłada jednego dawcę. W mieszaninie allele pochodzą od kilku osób, a wynik może stworzyć nieistniejący „kompozyt”.

Przed analizą:

  • oceń profil STR;
  • ustal NOC;
  • rozważ separację;
  • sprawdź allele balance;
  • oceń możliwość major;
  • stosuj tylko zwalidowany model mixture.

„Major w STR” nie gwarantuje, że każdy SNP ma tego samego major, zwłaszcza przy dropout i biasie.

Degradacja i mała ilość

Brakujące SNP mogą:

  • zmniejszyć confidence;
  • przesunąć wynik;
  • uniemożliwić klasę;
  • uruchomić imputation.

Imputation przewiduje genotypy na podstawie linkage i panelu referencyjnego. Zwiększa kompletność, ale nie tworzy obserwacji. Dokładność zależy od ancestry i coverage.

W raporcie trzeba rozdzielić:

genotypy obserwowane
genotypy imputowane
cechy wyliczone

Genealogia śledcza

Investigative genetic genealogy, IGG/FGG, łączy:

  • gęste genotypowanie SNP;
  • przeszukiwanie bazy genealogicznej;
  • analizę wspólnych segmentów;
  • budowę drzew;
  • rekordy publiczne i archiwalne;
  • informację śledczą;
  • potwierdzenie kryminalistyczne.

SWGDAM opisuje IGG jako technikę generowania investigative leadów i zwraca uwagę na jakość, prywatność, zakres uprawnień i potwierdzenie.4

Familial search:

  • używa zwykle STR;
  • działa w państwowej bazie kryminalistycznej;
  • szuka bliskiej relacji;
  • podlega procedurom tej bazy.

IGG:

  • używa setek tysięcy SNP;
  • może korzystać z baz konsumenckich;
  • wykrywa dalszych krewnych;
  • buduje rozległe drzewa;
  • ujawnia więcej informacji genomowej.

Partial match powstały przypadkiem w rutynowym search jest jeszcze innym zdarzeniem.

Materiał wejściowy IGG

Próbka forensic może być:

  • stara;
  • zdegradowana;
  • mała;
  • zmieszana;
  • zużywalna;
  • zanieczyszczona.

Przed outsourcingiem dokumentuje się:

  • pozostałą ilość;
  • możliwość reanalizy;
  • zgodność profilu STR;
  • NOC;
  • controls;
  • wybór technologii;
  • plan po niepowodzeniu;
  • zasady destrukcyjnego użycia.

NIJ podkreśla, że IGG wymaga innego, rozległego profilu SNP niż standardowe przeszukiwanie CODIS i często zewnętrznego wykonawcy.5

Microarray, target enrichment i WGS

Microarray odczytuje wcześniej wybrane SNP. Potrzebuje względnie dobrej ilości i jakości DNA oraz jest wrażliwy na mieszaniny.

Targeted sequencing wzbogaca panel genealogiczny i może pracować z mniejszą lub bardziej zdegradowaną próbką, zależnie od projektu.

Whole-genome sequencing daje odczyty w całym genomie i może następnie użyć genotype likelihood oraz imputation.

Porównania technologii pokazują różnice w shared-cM accuracy zależne od ilości, degradacji i panelu, dlatego wyboru nie opiera się wyłącznie na największej liczbie SNP.6

Coverage i genotype likelihood

W low-pass WGS jeden SNP może mieć:

0 reads alt
1 read alt

Twarde wywołanie heterozygoty jest niepewne. Genotype likelihood zachowuje możliwość AA/AB/BB. Imputation wykorzystuje haplotypy referencyjne.

QC obejmuje:

  • coverage;
  • call rate;
  • heterozygosity;
  • contamination;
  • transition/transversion;
  • allele balance;
  • duplicates;
  • sex concordance;
  • ancestry;
  • kinship;
  • zgodność z STR.

Zgodność SNP–STR

Profil genealogiczny z próbki powinien być powiązany z profilem dowodowym:

  • bezpośrednie loci, jeśli panel je obejmuje;
  • przewidywane allele STR z WGS, jeśli metoda zwalidowana;
  • wspólne sex markers;
  • reekstrakcja;
  • ścisły chain of identity.

Nie wolno przyjąć, że plik SNP od vendora należy do właściwej próbki tylko dlatego, że nazwa pliku się zgadza.

Segmenty IBD

Dalsi krewni dzielą fragmenty odziedziczone od wspólnych przodków. Długość mierzy się w centymorganach, jednostce rekombinacyjnej, a nie w milionach zasad.

Wynik może zawierać:

  • total shared cM;
  • longest segment;
  • number of segments;
  • X sharing;
  • predicted relationship range.

Ta sama liczba cM pasuje do kilku relacji. Na przykład około 200 cM może wynikać z różnych kombinacji kuzynostwa, pokoleń i half-relations.

Losowość dziedziczenia poszerza zakres

Oczekiwany udział DNA maleje z pokoleniami, ale rzeczywisty udział jest losowy przez rekombinację. Dwoje kuzynów tego samego stopnia może dzielić różną liczbę segmentów, a dalecy krewni mogą nie dzielić wykrywalnego odcinka.

Dlatego relację ocenia się z rozkładu:

P(shared segments | relationship R)

a nie z tabeli, w której jednej wartości cM przypisano jedną nazwę. Wiek i różnica pokoleń pomagają odrzucić niemożliwe relacje, ale nie zmieniają genetycznej niepewności w pewność.

Wiele matches nie zawsze jest niezależne

Trzech użytkowników z tej samej gałęzi może dzielić z próbką ten sam odcinek odziedziczony od jednego przodka. Nie są trzema niezależnymi dowodami.

Przykład:

A i B to rodzeństwo
C jest dzieckiem A
X pasuje do wszystkich

Match X–C jest częściowo przewidywalny z X–A. Drzewo powinno modelować relacje między matchami, a nie mnożyć „siłę” każdego wiersza.

IBD a IBS

IBS oznacza taki sam allel lub haplotyp bez pewności wspólnego niedawnego przodka. Krótkie segmenty częściej są przypadkowe lub populacyjne.

Algorytm ustala progi i fazuje haplotypy. Phasing error może:

  • przerwać prawdziwy segment;
  • połączyć dwa;
  • przypisać segment do niewłaściwego rodzica.

Dlatego nie buduje się drzewa z pojedynczego małego match.

Shared matches i triangulacja

Jeśli próbka X dzieli segment z A i B, a A oraz B również dzielą ten sam segment, może istnieć wspólny przodek. To triangulacja genetyczna.

Shared-match cluster może wskazać gałąź:

cluster 1 → linia matki ojca
cluster 2 → linia ojca matki

Nie każdy portal ujawnia segmenty, a algorytmy różnią się. Brak shared match nie wyklucza relacji.

Od matcha do drzewa

Workflow genealogiczny:

  1. oceń jakość SNP;
  2. uporządkuj matches według segmentów i cM;
  3. pogrupuj shared matches;
  4. zbuduj drzewa matchów;
  5. znajdź parę wspólnych przodków;
  6. rozwiń potomków;
  7. połącz dwie niezależne gałęzie;
  8. filtruj czasem, miejscem i płcią;
  9. zweryfikuj każdy link dokumentem;
  10. wygeneruj kandydatów.

Nie kopiuje się publicznego drzewa bez weryfikacji. Użytkownicy wpisują przybliżenia, osoby społeczne i błędne relacje.

Zbieżność dwóch gałęzi

Silny workflow próbuje znaleźć co najmniej dwa genealogicznie rozdzielone tory. Jeden cluster może prowadzić do przodków ojcowskich, drugi do matczynych. Kandydat leży na przecięciu potomków obu par.

Jeżeli cała identyfikacja opiera się na jednym dalekim matchu:

  • zakres potomków jest ogromny;
  • błąd jednego aktu zmienia rodzinę;
  • endogamia może imitować relację;
  • nie ma niezależnej kontroli drugiej strony rodowodu.

Druga gałąź nie zawsze jest dostępna. Wtedy status leada pozostaje słabszy i potrzeba dodatkowego targeted testing.

Targeted testing krewnych

Za zgodą można poprosić wybranego krewnego o próbkę, aby:

  • potwierdzić gałąź;
  • rozdzielić dwie możliwe relacje;
  • fazować segmenty;
  • ustalić, czy match pochodzi od matki czy ojca;
  • skrócić listę potomków.

Taka osoba musi wiedzieć, że badanie może ujawnić biologiczną relację i służy sprawie śledczej. Nie przedstawia się go jako neutralnego „badania genealogicznego”.

Wynik targeted testing nadal może być pośrednim leadem. Ostatecznie porównuje się kandydata z próbką dowodową.

Źródła genealogiczne

Możliwe:

  • akty urodzenia, małżeństwa i zgonu;
  • nekrologi;
  • spisy ludności;
  • księgi parafialne;
  • groby;
  • rejestry migracyjne;
  • archiwa wojskowe;
  • gazety;
  • publiczne profile;
  • drzewa użytkowników.

Każde ma provenance. Zbieżne imię i data nie dowodzą tożsamości. Rekord może dotyczyć innego Jana Kowalskiego.

Drzewo biologiczne i społeczne

Dokumenty opisują relacje prawne lub deklarowane. DNA opisuje biologiczne dziedziczenie.

Różnice:

  • adopcja;
  • ojcostwo społeczne;
  • donor conception;
  • zmiana nazwiska;
  • second marriage;
  • non-paternity;
  • nieformalna opieka.

Genealog nie „poprawia” rodziny publicznie. Tworzy kontrolowane hipotezy i chroni nieoczekiwane relacje.

Pedigree collapse i endogamia

Pedigree collapse oznacza, że ta sama osoba jest przodkiem kilkoma drogami. Endogamia tworzy wiele wspólnych przodków w populacji.

Skutki:

  • zawyżony total cM dla oczekiwanej relacji;
  • wiele małych segmentów;
  • liczne shared matches;
  • trudne rozdzielenie gałęzi;
  • zbyt bliska automatyczna etykieta.

Potrzebne są modele wielu dróg i dodatkowe matches. Jedna tabela cM nie wystarcza.

Uniparental markers w genealogii

Y-DNA może wskazać linię ojcowską, mtDNA — matczyną. Pomagają odrzucić gałęzie, ale:

  • wiele osób dzieli haplotyp;
  • mutacje zmieniają dystans;
  • nazwisko nie gwarantuje Y;
  • zgodność mtDNA bywa szeroka.

Są filtrami, nie końcowym dowodem osoby.

Kandydat

Lista kandydatów może wynikać z przecięcia:

potomkowie pary przodków A
∩ potomkowie pary przodków B
∩ płeć zgodna z próbką
∩ odpowiedni wiek
∩ możliwy związek z miejscem

Każdy filtr ma błędy. Osoba może mieszkać gdzie indziej, dokument mieć złą datę, a sex marker być niepełny.

Fenotyp jako dodatkowy filtr

Jeśli drzewo daje troje rodzeństwa, fenotyp może wskazać:

  • wyższe prawdopodobieństwo niebieskich oczu;
  • prawdopodobny przedział wieku;
  • predykcję pigmentacji.

Nie należy odrzucić kandydata wyłącznie dlatego, że zdjęcie z mediów społecznościowych wydaje się mieć inny kolor oczu. Fotografia i model mają błędy.

IGG tworzy lead

Raport genealogiczny może powiedzieć:

Dane SNP i źródła genealogiczne wskazują, że dawca próbki może należeć do określonej gałęzi rodziny; osoby A i B spełniają przyjęte kryteria śledcze.

Nie:

DNA udowadnia, że A jest sprawcą.

Amerykańska polityka DOJ, użyteczna jako przykład governance, wymaga między innymi wcześniejszego wykorzystania CODIS, wyczerpania rozsądnych leadów, współpracy laboratorium, śledczych i prokuratora oraz traktuje FGGS jako etap śledczy.7

Potwierdzenie

Po wytypowaniu osoby:

  1. sprawdź, czy lead nie opiera się na błędnym rekordzie;
  2. ustal legalny sposób pobrania;
  3. zachowaj niezależność próbki potwierdzającej;
  4. wykonaj standardowy profil STR;
  5. porównaj z dowodem;
  6. oblicz LR;
  7. sprawdź wykluczające informacje;
  8. niezależnie zrecenzuj;
  9. udokumentuj przejście od IGG do dowodu.

Próbka potwierdzająca może wykluczyć kandydata. To prawidłowe działanie metody, nie powód do ukrycia genealogii.

Surreptitious sample

Porzucony kubek albo śmieć może dostarczyć DNA, lecz legalność pobrania i użycia zależy od jurysdykcji. Z naukowego punktu widzenia dochodzi pytanie atrybucji:

  • kto używał przedmiotu;
  • czy jest mieszanina;
  • czy przedmiot przeniesiono;
  • czy profil jest pełny.

Formalna próbka referencyjna po zatrzymaniu może nadal być potrzebna.

Wykluczenie i exoneration

IGG może:

  • wskazać innego kandydata;
  • zidentyfikować nieznane szczątki;
  • wykluczyć rodzinę;
  • pomóc wznowić sprawę błędnego skazania.

Workflow musi pozwalać na wyniki odciążające. Confirmation bias jest szczególnie groźny, gdy zbudowano już wielkie drzewo wokół atrakcyjnej historii.

Prywatność krewnych

Użytkownik bazy ujawnia informację o osobach, które nigdy nie testowały DNA. Dalszy krewny może pozwolić na wskazanie całej rodziny.

Ryzyka obejmują:

  • nieoczekiwane pokrewieństwo;
  • adresy i daty żyjących;
  • stan adopcyjny;
  • pochodzenie;
  • identyfikację osób nieobjętych sprawą;
  • wtórne użycie profilu;
  • wyciek pliku genomowego.

Zgoda jednej osoby nie jest pełną zgodą jej całej rodziny.

Preferencje bazy

Bazy mają różne kategorie dostępu i zmieniają regulaminy. Przykładowo aktualna polityka GEDmatch przewiduje kilka ustawień prywatności i deklaruje wyraźny opt-in dla określonego dostępu organów ścigania.8

Zasady praktyczne:

  • używaj tylko baz dopuszczających dany typ sprawy;
  • przestrzegaj ustawienia konkretnego kitu;
  • dokumentuj wersję regulaminu i datę;
  • nie obchodź ograniczeń technicznych;
  • nie podszywaj się pod zwykłego użytkownika;
  • usuń upload zgodnie z polityką po zakończeniu;
  • zachowaj dowód legalności dostępu.

Regulamin przedsiębiorstwa nie zastępuje prawa, a zgoda w regulaminie nie naprawia działania organu bez podstawy prawnej.

Proporcjonalność

Przed uruchomieniem IGG ocenia się:

  • wagę sprawy;
  • realną potrzebę;
  • wyczerpanie mniej ingerujących metod;
  • jakość próbki;
  • szansę wyniku;
  • liczbę osób objętych wyszukiwaniem;
  • ryzyko błędnego leada;
  • zasady dostępu i retencji;
  • nadzór.

Identyfikacja szczątków może mieć inny bilans niż poszukiwanie sprawcy. Nie zakłada się automatycznie tych samych uprawnień.

Granica celu

Profil utworzony do zidentyfikowania szczątków może ujawnić, że osoba była biologicznym krewnym kogoś z bazy. Nie oznacza to automatycznej zgody na:

  • śledztwo karne dotyczące krewnego;
  • przewidywanie chorób;
  • badanie ancestry całej rodziny;
  • trening komercyjnego modelu;
  • pozostawienie profilu do przyszłych nieokreślonych spraw.

Purpose limitation wymaga nowej oceny, gdy cel się zmienia. To szczególnie ważne, gdy system bazy traktuje unidentified remains inaczej niż suspect kits.

Koniec sprawy

Plan retencji powstaje przed uploadem:

  • kiedy profil zostanie usunięty z bazy;
  • co zachowuje laboratorium;
  • co zachowuje genealog;
  • co trafia do akt;
  • jak usuwa się dane odrzuconych rodzin;
  • kto potwierdza usunięcie;
  • co dzieje się po uniewinnieniu albo błędnym leadzie.

Bez procedury „close” tymczasowy profil może stać się stałym narzędziem wtórnego przeszukiwania.

Minimalizacja

Genealog nie potrzebuje pełnej historii każdej osoby. System może:

  • używać pseudonimów;
  • ukrywać żyjących poza zespołem;
  • rozdzielić profile SNP od akt;
  • ograniczać eksport;
  • usuwać odrzucone gałęzie;
  • rejestrować dostęp;
  • przechowywać tylko podstawę leada.

Jednocześnie audit trail musi pozwolić sprawdzić rozumowanie. Minimalizacja nie oznacza braku dokumentacji.

Outsourcing

Vendor może wykonywać:

  • ekstrakcję;
  • bibliotekę;
  • sekwencjonowanie;
  • imputation;
  • upload;
  • analizę matches;
  • budowę drzewa.

Umowa określa:

  • własność danych;
  • lokalizację serwera;
  • podwykonawców;
  • dozwolone bazy;
  • retencję;
  • breach notification;
  • zwrot materiału;
  • pliki surowe;
  • walidację;
  • możliwość niezależnego review;
  • zakaz wtórnego treningu modeli.

„Usługa kompleksowa” nie przenosi odpowiedzialności.

Kompetencje

Zespół potrzebuje:

  • genetyki populacyjnej;
  • technologii SNP;
  • bioinformatyki;
  • genealogii dokumentowej;
  • prawa;
  • ochrony danych;
  • wiedzy śledczej;
  • komunikacji.

Osoba dobra w budowie drzew nie musi rozumieć mieszankowego genotype likelihood. Analityk DNA nie musi znać archiwów parafialnych. Role są rozdzielone i wzajemnie recenzowane.

Audit trail genealogiczny

Dla każdego kroku zachowuje się:

  • źródło;
  • URL lub archiwalny rekord;
  • datę dostępu;
  • obraz dokumentu;
  • wnioskowaną relację;
  • poziom pewności;
  • alternatywne osoby;
  • decyzję o odrzuceniu;
  • autora i recenzenta.

Drzewo w formie obrazka nie pokazuje, dlaczego połączono dwa rekordy.

Materiał dla obrony i niezależnego eksperta

Gdy lead prowadzi do dowodu procesowego, musi być możliwe zbadanie, czy:

  • użyto właściwej próbki;
  • profil SNP był pojedynczy i dobrej jakości;
  • dostęp do bazy był dozwolony;
  • algorytm nie pominął kluczowych matches;
  • drzewo nie zawierało błędnych połączeń;
  • kandydat nie został wybrany selektywnie;
  • próbka potwierdzająca była właściwie przypisana.

Zakres ujawnienia zależy od prawa i ochrony osób trzecich. Ochrona prywatności nie powinna jednak zamieniać metody w nieweryfikowalną „tajemnicę śledczą”. Możliwe rozwiązania to redakcja danych krewnych, kontrolowany dostęp eksperta i ujawnienie metodologii bez publikacji pełnych genomów.

Wynik negatywny również jest danymi jakościowymi

Operacja powinna rejestrować:

  • profile bez użytecznych matches;
  • drzewa kończące się zbyt szeroką listą;
  • kandydatów wykluczonych STR;
  • błędne relacje;
  • przypadki zatrzymane przez privacy setting;
  • nieudane potwierdzenie.

Tylko katalog sukcesów nie pozwala oszacować skuteczności ani false lead burden. Monitoring negatywów może ujawnić, że określona platforma albo threshold działa gorzej dla zdegradowanych próbek.

Quality assurance

Program obejmuje:

  • walidację genotypowania;
  • proficiency tests;
  • kontrolowane test cases;
  • podwójny review drzewa;
  • politykę nieoczekiwanych relacji;
  • checklistę legalności;
  • incident response;
  • security testing;
  • okresowy audit;
  • monitoring błędnych leadów.

Skuteczność liczy nie tylko solved cases. Potrzebne są:

  • liczba wykluczonych kandydatów;
  • czas;
  • false leads;
  • przypadki z naruszeniem polityki;
  • failed genotyping;
  • koszty;
  • nierówny wpływ na grupy.

Human factors

Genealog może:

  • przywiązać się do pierwszego drzewa;
  • preferować znane nazwisko;
  • przeoczyć drugie małżeństwo;
  • uznać wiek za dokładny;
  • przeszukać media przed ukończeniem genetyki;
  • wypełnić lukę intuicją.

Kontrole:

  • sekwencja danych;
  • niezależna równoległa gałąź;
  • jawne confidence levels;
  • checklisty;
  • review bez znajomości preferowanego kandydata;
  • zapis hipotez alternatywnych.

Raport fenotypowy

Powinien zawierać:

  • próbkę i jakość;
  • assay i wersję;
  • obserwowane/imputowane markery;
  • model i training population;
  • prawdopodobieństwa wszystkich klas;
  • regułę decyzji;
  • znaną performance;
  • kategorię nieokreśloną;
  • ograniczenia populacji, wieku i środowiska;
  • ostrzeżenie, że jest to lead.

Nie powinien zawierać jednego zdania „osoba ma niebieskie oczy”.

Raport genealogiczny

Powinien rozdzielać:

  1. jakość profilu SNP;
  2. bazę i ustawienia dostępu;
  3. główne matches i segmenty;
  4. źródła rodowodu;
  5. hipotezę wspólnych przodków;
  6. listę kandydatów i filtry;
  7. alternatywne drzewa;
  8. ograniczenia;
  9. wymagane potwierdzenie;
  10. retencję i status danych.

Nie umieszcza się zbędnych danych żyjących krewnych w zwykłych aktach sprawy.

Studium 1: „niebieskie oczy 0,61”

Wynik:

blue 0,61; intermediate 0,12; brown 0,27

Komunikat „ma niebieskie oczy” usuwa 39% masy innych klas i nie uwzględnia błędu kalibracji. Właściwie: model umiarkowanie preferuje kategorię niebieską.

Studium 2: portret fotorealistyczny

Panel przewidział pigmentację, lecz wykonawca narysował kształt nosa, uszu, zarost i fryzurę.

Te elementy są ilustracją. Publikacja obrazu jako „twarzy z DNA” może skierować świadków na fałszywe rozpoznanie.

Studium 3: ancestry i narodowość

Model wspiera mieszane pochodzenie europejskie i zachodnioazjatyckie. Raport mówi „obywatel kraju X”.

To nieuprawnione. Genom nie koduje paszportu, a klastry obejmują wiele populacji.

Studium 4: model wieku krwi dla nasienia

Algorytm krwi szacuje 58 lat dla śladu nasienia od dawcy 36-letniego.

Próbka jest poza zakresem tissue model. Liczba nie jest dowodem starszego dawcy.

Studium 5: mieszanka w IGG

Próbka ma dwóch dawców 70:30, ale pipeline zakłada jednego. Heterozygosity jest ekstremalna, a matches są chaotyczne.

Nie imputuje się „przez problem”. Najpierw potrzebna jest separacja albo zwalidowany mixture workflow; w przeciwnym razie analiza się kończy.

Studium 6: match 220 cM

Portal opisuje relację jako second cousin. Genealog buduje jedno drzewo.

220 cM ma wiele możliwych relacji. Buduje się zakres hipotez, używa wieku, shared matches i segmentów, a nie etykiety portalu jako faktu.

Studium 7: endogamia

Kilku użytkowników dzieli wiele małych segmentów, a total cM sugeruje bliskich krewnych. Wszyscy pochodzą z historycznie endogamicznej populacji.

Model jednej pary przodków zawyża bliskość. Potrzebne są segmenty długie, wiele gałęzi i ostrożniejszy próg.

Studium 8: błędny nekrolog

Nekrolog przypisuje syna do drugiego małżeństwa, lecz akt urodzenia wskazuje pierwsze. Kandydat z atrakcyjnym miejscem zamieszkania zostaje wykluczony po weryfikacji.

Jedno źródło wtórne nie zamyka relacji.

Studium 9: trafny lead, zły kandydat

IGG wskazuje rodzinę i dwóch braci. Lokalizacja preferuje A, lecz potwierdzający STR wyklucza A i wspiera B.

Genealogia była trafna na poziomie rodziny. Dowodem osoby jest dopiero porównanie referencyjne.

Studium 10: użytkownik opt-out

Praktyk obchodzi ustawienie prywatności, aby zobaczyć matches. Wynik prowadzi do kandydata.

Skuteczny lead nie legalizuje naruszenia. Dostęp, dane i dalsze kroki podlegają dochodzeniu; organizacja potrzebuje incident response.

Najczęstsze błędy

Fenotyp to wygląd. Jest prawdopodobieństwem kategorii.

DNA tworzy fotografię. Większość szczegółów wizualizacji jest założona.

Pochodzenie to rasa lub narodowość. Nie.

Wiek epigenetyczny datuje ślad. Zwykle szacuje wiek dawcy dla określonej tkanki.

Najwyższa klasa jest pewna. Może mieć 0,4.

Accuracy wystarcza. Potrzebne są klasy i calibration.

Mieszanina da średni wygląd. Może stworzyć bezsensowny produkt.

Imputation odczytuje brakujące SNP. Przewiduje je.

IGG przeszukuje nazwiska w DNA. Przeszukuje segmenty i buduje drzewa.

Shared cM ma jedną relację. Ma zakres.

Publiczne drzewo jest dokumentem. Jest źródłem do weryfikacji.

Hit wskazuje sprawcę. Wskazuje lead rodzinny.

Potwierdzenie jest formalnością. Może wykluczyć.

Regulamin bazy jest podstawą prawną. Jest tylko jedną warstwą.

Skuteczność usprawiedliwia obejście prywatności. Nie.

Lista kontrolna

  1. Czy celem jest cecha, ancestry, wiek czy pokrewieństwo?
  2. Czy assay jest zwalidowany dla próbki?
  3. Czy występuje mieszanina?
  4. Które genotypy są obserwowane, a które imputowane?
  5. Czy populacja odpowiada modelowi?
  6. Czy podano pełne prawdopodobieństwa?
  7. Czy znana jest confusion matrix i calibration?
  8. Czy wizualizacja odróżnia dane od grafiki?
  9. Czy istnieje podstawa prawna IGG?
  10. Czy sprawa spełnia kryteria proporcjonalności?
  11. Czy mniej ingerujące metody wykorzystano?
  12. Czy baza dopuszcza typ sprawy i konkretne ustawienie kitu?
  13. Czy vendor ma kontrolowaną retencję?
  14. Czy profil SNP zgadza się z dowodem?
  15. Czy matches są segmentowe i wysokiej jakości?
  16. Czy rozważono wiele relacji dla shared cM?
  17. Czy endogamia lub pedigree collapse występują?
  18. Czy każdy link drzewa ma źródło?
  19. Czy dane żyjących są minimalizowane?
  20. Czy kandydat zostanie niezależnie potwierdzony STR?

Co zapamiętać

  1. Fenotypowanie i IGG tworzą wskazówki, nie identyfikację sprawcy.
  2. Fenotyp jest rozkładem prawdopodobieństwa.
  3. Pochodzenie biogeograficzne nie jest narodowością ani rasą.
  4. Model wieku jest zależny od tkanki.
  5. Fotorealistyczny portret zawiera wiele informacji niepochodzących z DNA.
  6. IGG wymaga gęstego profilu SNP i genealogii dokumentowej.
  7. Shared cM odpowiada wielu relacjom.
  8. Endogamia i błędne drzewa mogą tworzyć fałszywe leady.
  9. Preferencje użytkowników, podstawa prawna i minimalizacja są częścią poprawności.
  10. Ostateczne potwierdzenie wymaga nowej próbki i standardowego porównania kryminalistycznego.