Jag är doktorand och min forskning fokuserar på att utveckla datorprogram som kan undersöka arvsmassan hos enskilda mikroorganismer, även när man har miljontals celler att analysera.
Mikrobiella samhällen finns nästan överallt: i människans tarm, i jord och sjöar, kring hydrotermala källor på havsbotten och till och med i giftiga gruvutsläpp. Metagenomisk sekvensering används för att studera dessa samhällen genom att allt DNA i ett prov extraheras och sekvenseras samtidigt. Från ett enda experiment kan forskare identifiera vilka organismer som finns i provet, hur vanliga de är och vilka gener de bär på. Detta ger en ögonblicksbild av ett helt mikrobiellt samhälle direkt från dess naturliga miljö.
Metoden har revolutionerat mikrobiologin men har en viktig begränsning. Eftersom DNA från alla celler blandas ihop går det inte att avgöra vilka DNA-fragment som kommer från vilken cell. Genom måste därför rekonstrueras från blandningen, vilket kan göra att närbesläktade stammar slås samman till en gemensam genomsekvens samtidigt som sällsynta organismer helt missas.
Förlusten av information om enskilda celler är också problematisk när det gäller mobila genetiska element, DNA-sekvenser som bakterier kan överföra mellan varandra och som ofta bär gener för antibiotikaresistens. Traditionell metagenomisk sekvensering kan upptäcka dessa element, men kan vanligtvis inte avgöra vilka organismer som bär på dem, om de finns på separata DNA-molekyler eller har integrerats i värdorganismens genom, eller hur många kopior som finns i varje cell. Därför återstår flera grundläggande forskningsfrågor. Vi vet fortfarande förhållandevis lite om hur antibiotikaresistens sprids genom mikrobiella samhällen, hur stor del av den mikrobiella mångfalden som fortfarande är dold för oss i form av sällsynta stammar och ännu okarakteriserade organismer, eller hur dessa faktorer hänger samman.
Encellsmetagenomisk sekvensering (scMetaG) löser många av dessa problem genom att bevara kopplingen mellan varje sekvenserad DNA-sekvens och den cell den kommer från. Genom kan då spåras tillbaka till enskilda celler, vilket gör det möjligt att identifiera individuella stammar samt sällsynta eller tidigare okända organismer. Mobila genetiska element kan dessutom kopplas direkt till de celler som bär dem.
Tekniken utvecklas dock snabbt och kan redan nu generera data från miljontals celler per prov, långt mer än vad dagens verktyg för encellsgenomik klarar av att hantera. Samtidigt är de flesta metagenomiska analysverktyg utvecklade för data där information om enskilda celler saknas. Encellsdata har dessutom egna tekniska utmaningar, såsom ojämn DNA-amplifiering, kimeriska sekvenser och kontaminering mellan celler.
En metod för att hantera flera av dessa problem är så kallad co-assembly. Genom att kombinera data från närbesläktade celler samtidigt som informationen om vilken cell varje sekvens kommer från bevaras, kan man rekonstruera genom även från celler där DNA-amplifieringen varit otillräcklig. Metoden gör det också möjligt att bygga pangenom som beskriver den genetiska variationen mellan celler av samma art.
Mitt doktorandprojekt handlar om att utveckla den programvara som krävs för att analysera denna typ av data. Det innefattar bland annat en förbehandlingspipeline, en de novo-baserad co-assembler för att rekonstruera genom och pangenom samt verktyg för genomannotering. Programvaran utvecklas i programmeringsspråket Rust och bygger på bland annat kortfattade datastrukturer och sketching-metoder som effektivt komprimerar och sammanfattar data utan att förlora den information som behövs för analys. På så sätt blir analyser möjliga som annars skulle vara för beräkningskrävande med konventionella verktyg. Samtliga verktyg kommer att utvärderas med hjälp av simulerade dataset och modellorganismsamhällen med känd sammansättning.