- Linux, Git, Python i R: co do czego służy
Praktyczna mapa czterech podstawowych narzędzi bez udawania, że trzeba od razu opanować je wszystkie. Artykuł powiąże każde z nich z konkretnymi zadaniami biologicznymi.
- FASTA, FASTQ, BAM i VCF
Wprowadzenie do najczęstszych formatów sekwencji, odczytów, uliniowień i wariantów. Czytelnik nauczy się rozpoznawać, jaką informację zawiera plik i czego nie można z niego wywnioskować.
- Bazy danych dla biologa
Przewodnik po NCBI, ENA, Ensembl, UniProt, GEO, SRA, Expression Atlas i repozytoriach linii komórkowych: dobór bazy do pytania, accessiony, wersje i zapisywanie identyfikatorów danych.
- NCBI, ENA i DDBJ: jeden archiwalny ekosystem sekwencji
Praktyczny przewodnik po INSDC i relacjach GenBank/SRA–ENA–DDBJ/DRA: BioProject, BioSample, study, experiment, run i analysis, prefiksy accessionów, accession.version, GCA/GCF, WGS, synchronizacja, aktualizacje, kontrolowany dostęp, API, checksumy, manifesty oraz śledzenie próbki od materiału do pliku.
- Ensembl i UCSC Genome Browser: jak czytać genom w kontekście
Praktyczna nauka czytania genomu jako osi referencyjnej z niezależnymi warstwami danych: assembly, 1-based i BED, nić, modele genów i wersje transkryptów, regulatory build, warianty, mapowalność, comparative genomics, custom tracks, eksport, API oraz kontrolowany liftOver.
- ClinVar, gnomAD i ClinGen: od wariantu do siły dowodu
Przewodnik po trzech odrębnych poziomach oceny wariantu: zgłoszeniach SCV/VCV/RCV i review stars w ClinVar, częstościach AC/AN/AF, grpmax i FAF w gnomAD oraz gene–disease validity i regułach ClinGen. Tekst uczy ważyć dowody ACMG/AMP bez mylenia klasyfikacji z diagnozą.
- GEO, SRA i Expression Atlas: gdzie trafiają dane omiczne
Mapa publicznego eksperymentu omicznego od projektu i próbki przez bibliotekę, run i FASTQ po macierz oraz wynik: GSE/GSM/GPL, BioProject/BioSample/SRX/SRR, pliki supplementary, Expression Atlas, metadane, batch, kontrolowany dostęp i odtwarzalna reanaliza.
- Human Cell Atlas, CELLxGENE i atlasy single-cell
Przewodnik po atlasie jako wersjonowanej referencji: projektach HCA, CELLxGENE Discover i Census, AnnData/Loom, metadanych, counts, QC, ambient RNA, doubletach, batch effect, integracji, UMAP, ontologiach, label transfer, pseudobulk, reprezentacji dawców i kontrolowanym dostępie.
- Addgene i repozytoria materiału biologicznego: od rekordu do próbki
Praktyczna droga od accessionu do zakwalifikowanej probówki: mapy i sekwencje plazmidów, ori, liczba kopii, partycja, niezgodność, lokalne QC, biblioteki, wektory wirusowe, MTA, banki, transport i chain of identity.
- Workflow i kontrola jakości danych
Od surowego pliku przez kontrolę jakości i analizę do raportu, z jawnymi wersjami narzędzi i parametrami. Omówione zostaną menedżery środowisk, workflow oraz podstawy powtarzalności.
- Moc obliczeniowa i przechowywanie danych
Jak oszacować RAM, CPU, GPU, I/O, miejsce i czas dla analiz, dobrać laptop, HPC lub chmurę oraz potraktować komputer jako część toru sekwencjonowania nanoporowego.
- AI w biologii bez skrótów myślowych
Od jednostki analizy, przecieku, zmiany domeny i kalibracji przez AlphaFold, obrazowanie i omiki po eksperymentalne oraz kliniczne bramki odkrywania leków wspieranego przez AI.
Bioinformatyka
Minimalny stos narzędzi do pracy z publicznymi danymi genomowymi i komórkowymi.