NASA and Orphan Black

A few months ago I wrote a post about the (fictitious, and also evil) clone experiment in Orphan Black. I said that comparison of complex traits between a handful of individuals isn’t, even in principle, a ”scientifically beautiful setup to learn myriad things”, but garbage. You can’t take two humans, even if they’re clones, put them in different environments, and expect to learn much of anything.

Funnily enough, it seems like NASA has been doing just that with the NASA twin study: there are two astronauts who are twins, and researchers have compared various things between them and before/after one of them went to space. Of course, those various things include headline-attracting assays like telomere length and DNA methylation (including ”epigenetic age” — something like Horvath 2013, I assume).

The news coverage has been confused — mixing up DNA methylation, gene expression and mutation. But can one blame news outlet for reporting about ”7% changes to his DNA” and ”space genes” when the press release said this:

Another interesting finding concerned what some call the “space gene”, which was alluded to in 2017. Researchers now know that 93% of Scott’s genes returned to normal after landing. However, the remaining 7% point to possible longer term changes in genes related to his immune system, DNA repair, bone formation networks, hypoxia, and hypercapnia.

Someone who knows some biology can guess that this doesn’t refer to mutation, but it’s not making things easy for the reader, and when put like that, the 7% could be DNA methylation, gene expression, or something else transient and genomic. (They’ve since clarified that it was gene expression — in some sample; my bet is on white blood cells.)

Now that we’ve made fun of NASA a little, there are some circumstances when we can learn useful things from studies of even a single individual. For example, if Chaser the Border Collie can learn the names of 1000 toys, and learn new toy names through reasoning by exclusion (Pilley & Reid 2011), then we can safely assume that this is within the realm of dog abilities. Another example is a reference genome, which in the best case is made from a single individual, ideally an individual who is as homozygous as possible. When comparing the reference genome to that of other species, we feel confident enough to publish genome papers with comparisons of gene content, gene family evolution, and selection on protein coding sequences over evolutionary timescales. But when it comes to functional genomics, many variable molecular trait measurements all along the genome? No.

The study is not out. It may be better than the advertisement. It’s seems they’ve compared the two men before and after, so they can get some handle on differences that came about in the years leading up to the study. And maybe they’ve run a crazy number of technical replicates to make sure that the value they get from each data point is as a good measurement as possible. And maybe there is data on what happens with these kinds of assays when people do other strenuous things, putting the differences into context. Maybe.


Pilley, John W., and Alliston K. Reid. ”Border collie comprehends object names as verbal referents.” Behavioural processes 86.2 (2011): 184-195.

Horvath, Steve. ”DNA methylation age of human tissues and cell types.” Genome biology 14.10 (2013): 3156.

Prata svenska

Nu när jag inte alls behöver prata om genetik på svenska känns det plötsligt extra viktigt att tänka på det.

Helst skulle jag förstås vilja kunna prata om genetik på svenska med termer som är begripliga, smidiga och inte känns konstlade. Vad som känns konstlat är naturligtvis en smakfråga. Ska man skriva ”enbaspolymorfier” eller ”snippar”? Det första låter som kanslihussvenska och det andra är ett lustigt ljud med genitala associationer.

Jag kan komma på alla möjliga svepskäl att inte prata om genetik på svenska — ”det låter töntigt”; ”det finns inte ord” — men de är inte särskilt bra. Det är också såklart sant att någon som jag är bättre på mitt modersmål än ett andra språk jag lärde mig skolan, och antagligen både tänker och skriver mer effektivt och nyanserat på svenska än på engelska.

Vilka är de bästa källorna till svenska genetiska termer? Jag antar att de flesta svensktalande genetiker gör som jag och litar till en blandning av: vad vi hört äldre akademiker säga, uppslagsverk som Nationalencyklopedin och Wikipedia, Biotermgruppens lista, kanske KI-bibliotekets svenska MeSH-termer och, om allt annat tryter, översättning från engelska enligt eget huvud.

Genetisk terminologi har flera besvärliga egenskaper. Dels finns det många låneord från latin och grekiska — epistasi, pleiotropi, eukaryot, … — som antagligen inte direkt är självförklarande ens för den som kan latin eller grekiska. ”Epistasi” förresten … Biotermgruppen kallar det ”epistas”, KI-MeSH skriver ”epistasi” och Wikipedia ”epistasis”. Naturligtvis använder genetiker inom olika specialområden samma ord på olika sätt också. ”Pleiotropi” betyder tre olika saker (Paaby & Rockman 2013). Eller var det sju olika saker (Hodkin 1998)?

Sedan finns det massor av ord som betyder ungefär samma sak. Vad är skillnaden på ”variant” och ”allel”? Betyder ”gen” samma sak som ”locus”, eller är det ”variant” och ”locus” som betyder samma sak? Det beror på vem som svarar.

Och till sist verkar genetiker tro att att det hjälper läsaren, eller får dem att verka klyftiga, om de myntar massor av förkortningar. Och sedan helst, som med snipparna ovan, förvandlar förkortningarna till roliga små läten. Snipp och BLUP och tork och kvark voro sex små dvärgar.

Selected, causal, and relevant

What is ”function”? In discussions about junk DNA people often make the distinction between ”selected effects” and ”causal roles”. Doolittle & Brunet (2017) put it like this:

By the first (selected effect, or SE), the function(s) of trait T is that (those) of its effects E that was (were) selected for in previous generations. They explain why T is there. … [A]ny claim for an SE trait has an etiological justification, invoking a history of selection for its current effect.


ENCODE assumed that measurable effects of various kinds—being transcribed, having putative transcription factor binding sites, exhibiting (as chromatin) DNase hypersensitivity or histone modifications, being methylated or interacting three-dimensionally with other sites — are functions prima facie, thus embracing the second sort of definition of function, which philosophers call causal role …

In other words, their argument goes: a DNA sequence can be without a selected effect while it has, potentially several, causal roles. Therefore, junk DNA isn’t dead.

Two things about these ideas:

First, if we want to know the fraction of the genome that is functional, we’d like to talk about positions in some reference genome, but the selected effect definition really only works for alleles. Positions aren’t adaptive, but alleles can be. They use the word ”trait”, but we can think of an allele as a trait (with really simple genetics — its genetic basis its presence or absence in the genome).

Also, unfortunately for us, selection doesn’t act on alleles in isolation; there is linked selection, where alleles can be affected by selection without causally contributing anything to the adaptive trait. In fact, they may counteract the adaptive trait. It stands to reason that linked variants are not functional in the selected effect sense, but they complicate analysis of recent adaptation.

The authors note that there is a problem with alleles that have not seen positive selection, but only purifying selection (that could happen in constructive neutral evolution, which is when something becomes indispensable through a series of neutral or deleterious substitutions). Imagine a sequence where most mutations are neutral, but deleterious mutations can happen rarely. A realistic example could be the causal mutation for Freidreich’s ataxia: microsatellite repeats in an intron that occasionally expand enough to prevent transcription (Bidichandani et al. 1998, Ohshima et al. 1998; I recently read about it in Nessa Carey’s ”Junk DNA”). In such cases, selection does not preserve any function of the microsatellite. That a thing can break in a dangerous way is not enough to know that it was useful when whole.

Second, these distinctions may be relevant to the junk DNA debate, but for any research into the genetic basis of traits currently or in the future, such as medical genetics or breeding, neither of these perspectives is what we need. The question is not what parts of the genome come from adaptive alleles, nor what parts of the genome have causal roles. The question is what parts of the genome have causal roles that are relevant to the traits we care about.

The same example is relevant. It seems like the Friedriech’s ataxia-associated microsatellite does not fulfill the selected effect criterion. It does, however, have a causal role, and a causal role relevant to human disease, at that.

I do not dare to guess whether the set of sequences with causal roles relevant to human health is bigger or smaller than the set of sequences with selected effects. But they are not identical. And I will dare to guess that the relevant set, like the selected effect set, is a small fraction of the genome.


Doolittle, W. Ford, and Tyler DP Brunet. ”On causal roles and selected effects: our genome is mostly junk.” BMC biology 15.1 (2017): 116.

Johan Frostegård ”Evolutionen och jag”

Jag läste Johan Frostegårds bok om evolutionen och människan över jul. Frostegård är allmänbildad och skriver småtrevligt om lite allt möjligt — lite om människans förhistoria, evolutionära öppna frågor som sexuell fortplantning, altruism, typiskt mänskliga egenskaper, två kapitel om syfilis, plus författarens syn på vetenskaps-, medvetande- och moralfilosofi. Samt Gud och Bob Dylan. Det är kul med en bok om evolution som har så många skönlitterära citat. Det bästa kapitlet är nog kapitel 18, ”Immunologi, evolutionen och jag” som berör hans egen forskning.

Men jag har ett par invändningar. Det går för fort. Jag hänger inte med. Boken stannar aldrig särskilt länge på något ämne. Men det finns ett övergripande tema: att olika ämnen — medicin, moral, nationalekonomi, humaniora — skulle tjäna på en evolutionär analys. Tyvärr är den evolutionära analysen i boken ibland inte särskilt bra. Här är två exempel i detalj:

Så här står det på sidan 89 om färgseende:

Tänk bara på färgblindhet som finns i mycket högre grad hos män än hos kvinnor, och där en rätt rimlig förklaring kan vara att detta ger en fördel när det gäller synförmåga på långa distanser, där den färgblinde anses ha större förmåga att urskilja kontraster, vilket utnyttjats även i moderna arméer. Dess förekomst är statistiskt sett på många håll ungefär som om en i varje jägarlag skulle vara färgblind.

Vad är problemet här?

Det är inte uteslutet att röd–grön-färgblindhet kommer med vissa fördelar också skulle kunna vara föremål för naturligt urval i människor under vissa omständigheter. Som sagt, det finns forskning som tyder på att det finns fördelar och nackdelar med att se två respektive tre färger. Och det är tydligen inte helt ovanligt att primater har variation i färgseende inom arten (Surridge, Osorio & Mundy 2003).

Men frågan är, om det nu är bättre (obs, hypotetiskt) att se två färger och inte tre, varför är inte alla män färgblinda? Det finns flera olika omständigheter när naturligt urval göra så att det finns flera varianter av en gen i en population. Det vill säga: att det fortsätter finnas flera varianter av en gen, efter att den nya varianten uppstått genom mutation. Det händer när en variant är bra ibland, dålig ibland, och kallas balanserande selektion.

Det kan vara så att en genetisk variant har både positiva och negativa egenskaper, som gör att de individer som har en kopia av den (bär den i heterozygot tillstånd) får den bästa balansen av för- och nackdelar. Ett annat alternativ är att en genetisk variant ger fördelar när den är ovanlig i populationen, men är dålig när många andra bär på den.

Men det är också möjligt att färgblindhet uppstår hyfsat ofta genom mutation och att det inte är särskilt skadligt, och kan vara vanligt av den anledningen.

Hur det ligger till är en empirisk fråga. Det räcker inte med en idé om hur något skulle kunna vara en fördel för att ha en bra evolutionär hypotes. Vad tar läsaren med sig från resonemanget om hen inte redan vet vad balanserande selektion är? Jo, en typ av spekulation — om det finns ärftlig variation i egenskap X kanske det beror på att den har en evolutionär fördel — utan vidare data eller bevis, som är vanlig men missvisande.

Exempel 2: Det finns några passager och altruismens evolution och diskussionen om släktskap och gruppselektion.

E.O. Wilson beskriver människosläktets sociala förmåga, kallad eusocialitet, som en central egenskap, och anför till och med gruppselektion som en bakomliggande mekanism, det senare något som blivit mycket ifrågasatt. [38, 53] Gruppselektion innebär att konkurrensen i naturen, som är det naturliga urvalets motor, inte bara sker på individnivå utan även på gruppnivå. (s. 91)


Men en mindre grupp talar för teorin, med nestorn inom sociobiologi, E.O. Wilson, som ett framträdande namn. Han publicerade i den prestigefyllda tidskriften Nature en artikel där han med två medförfattare och matematiska modeller beskrev gruppselektion som en förklaring till social samverkan hos sociala djur som människan [38].

Studien blev genast omdebatterad och hårt kritiserad, bland annat av Richard Dawkins som menar att teorin om gruppselektion bortser från att det är generna som är i centrum för evolutionen, i kraft av att vara replikatorer. Detta förnekar inte heller Wilson. Dock är inte sista ordet sagt, och min gissning är att Wilsons uppfattning kommer vinna mark [37, 256]. (s. 307)

Ja, altruismnördar, referens nummer 38 är ingen mindre än Nowak, Tarnita & Wilson (2010). Nummer 256 är den svarsartikel som 140 evolutionsbiologer skrev i samma tidskrift. Och nej, det tillhör inte direkt vanligheterna att en vetenskaplig tidskrift följs av ett protestupprop i samma tidskrift. (Nummer 37 är en recension som Dawkins skrivit av en av Wilsons böcker.)

Det här är inte en lätt debatt att referera, och den går som synes något djupare än ett meningsutbyte mellan Wilson och Dawkins. Och Nowak, Tarnita & Wilson (2010) är inte någon lätt artikel att läsa. Det är nog inte bara författarnas fel, utan också tidskriftens utrymmesbegränsningars. Den består nämligen av sex sidor ”artikel” och 43 sidor ”supplementary materials” med alla detaljer. Den matematiska modellen får en dryg halv sida i själva artikeln, utan vare sig resultat eller beskrivning av metoden.

Vad kan vi säga om den?

För det första: ”eusocialitet” är inte riktigt ett ord för ”människans speciella sociala natur”. Det är det speciella sociala system där djur lever i kolonier där bara en minoritet reproducerar sig och de andra är sterila. Tänk bisamhällen, myrsamhällen och kolonier av nakenråttor. Författarna tycker uppenbarligen att eusocialitet har tillräckligt gemensamt med arbetsdelning hos människor för att det ska vara en intressant analogi, men det de skriver om människans sociala evolution i artikeln är bara det här:

We have not addressed the evolution of human social behavior here, but parallels with the scenarios of animal eusocial evolution exist, and they are, we believe, well worth examining.

För det andra: det här är en debatt om matematiska modeller. Det är inget fel med det. Matematiska modeller och teoretisk forskning är utmärkt, särskilt om man vill studera något som inte går att observera. I det här fallet hur ett visst beteende uppstod i en sedan länge utdöd förmoder och -fader till en art. Men en diskussion om det bästa sättet att bygga en matematisk modell för ett hypotetiskt scenario blir lätt en smula … teoretisk.

Om vi vill bygga matematiska modeller av hur altruism uppstod finns det lite olika sätt att räkna. Tänk på arbetsbina i ett bisamhälle. Varför har de förlorat förmågan att lägga ägg? Ett sätt är att räkna ut hur många barn de kan få indirekt genom att drottningen, alltså deras mamma, lägger ägg. Om deras arbete gör att drottningen lägger tillräckligt många ägg kan det vara ett effektivare sätt för dem att sprida sina gener än om de skulle ge sig ut i världen och lägga ägg på egen hand. Det är släktskapsselektion (Frostegård beskrier det på s. 304), och sättet att räkna kallas ”inclusive fitness”. ”Fitness” betyder reproduktiv framgång, och ”inclusive fitness” är reproduktiv framgång med släktingarnas bidrag inräknat.

För det tredje så handlar Nowak, Tarnita & Wilson (2010) inte om gruppselektion. Inte direkt, i alla fall. Artikeln är en attack mot släktskapsselektion som förklaring för eusocialitet. De hävdar istället att deras modell, som inte räknar på arbetarnas inclusive fitness, utan istället beskriver hur en mutation som får arbetare att stanna kvar i boet sprider sig i en population, är mer realistisk. Men framför allt verkar de tycka att den är snyggare. Så här skriver de i artikeln:

By formulating a mathematical model of population genetics and family structure, we see that there is no need for inclusive fitness theory. The competition between the eusocial and the solitary allele is described by a standard selection equation. There is no paradoxical altruism, no payoff matrix, no evolutionary game. A ”gene-centered” approach for the evolution of eusociality makes inclusive fitness theory unnecessary.

Och sedan i kommentarer på Nowaks grupps hemsida:

Our paper does not study group selection, and it does not compare group selection
and inclusive fitness. But given the limitations of inclusive fitness it is clear that many models of group selection cannot be analyzed in terms of inclusive fitness. Also note that our model for the evolution of eusociality is not a group selection model; instead it describes selection operating at the level of genes.

Som sagt, den här debatten är rätt teknisk, och på ren svenska en jävla röra. Jag förstår att man inte vill gå in på detaljer i en populärvetenskaplig bok på ämnet. Jag vill inte gå in på detaljer heller. Men än en gång kan man fråga sig om en läsare som inte redan är insatt i ämnet blir något klokare av det här. Vad får vi med oss förutom det felaktiga intrycket att eusocialitet är ”människosläktets sociala förmåga” och ett auktoritetsargument för gruppselektion?


Frostegård, Johan. (2017) Evolutionen och jag. Volante. Stockholm.

Nowak, Martin A., Corina E. Tarnita, Edward O. Wilson. (2010) ”The evolution of eusociality.” Nature 466.7310

Abbot, Patrick, et al. (2011) ”Inclusive fitness theory and eusociality.” Nature 471.7339

Surridge, Alison K., Daniel Osorio, and Nicholas I. Mundy. (2003) ”Evolution and selection of trichromatic vision in primates.” Trends in Ecology & Evolution 18.4

Nessa Carey ”Junk DNA”

I read two popular science books over Christmas. The other one was in Swedish, so I’ll do that in Swedish.

Nessa Carey’s ”Junk DNA: A Journey Through the Dark Matter of the Genome” is about noncoding DNA in the human genome. ”Coding” in this context means that it serves as template for proteins. ”Noncoding” is all the rest of the genome, 98% or so.

The book is full of fun molecular genetics: X-inactivation, rather in-depth discussion of telomeres and centromeres, the mechanism of noncoding microsatellite disease mutations, splicing — some of which isn’t often discussed at such length and clarity. It gives the reader a good look at how messy genomics can be. It has wonderful metaphors — two baseball bats with magnetic paint and velcro, for example. It even has an amusing account of the ENCODE debate. I wonder if it’s true that evolutionary biologists are more emotional than other biologists?

But it really suffers from the framing as a story about how noncoding DNA used to be dismissed as pointless, and now, surprisingly, turns out to have regulatory functions. This makes me a bit hesitant to recommend the book; you may come away from reading it with a lot of neat details, but misled about the big picture. In particular, you may believe a false history of all this was thought to be junk; look how wrong they were in the 70s, and the very dubious view that most of the human genome is important for our health.

On the first page of the book, junk DNA is defined like this:

Anything that doesn’t code for protein will be described as junk, as it originally was in the old days (second half of the twentieth century). Purists will scream, and that’s OK.

We should scream, or at least shake our heads, because this definition leads, for example, to describing ribosomes and transfer-RNA as ”junk” (chapter 11), even if both of them have been known to be noncoding and functional since at least the 60s. I guess the term ”junk” sticks, and that is why the book uses it, and why biologists love to argue about it. You couldn’t call the book something unspeakably dry like ”Noncoding DNA”.

So, this is a fun a popular science book about genomics. Read it, but keep in mind that if you want to define ”junk DNA” for any other purpose than to immediately shoot it down, it should be something like this:

For most of the 50 years since Ohno’s article, many of us accepted that most of our genome is ”junk”, by which we would loosely have meant DNA that is neither protein-coding nor involved in regulating the expression of DNA that is. (Doolittle & Brunet 2017)

The point of the term is not to dismiss everything that is not coding for a protein. The point is that the bulk of DNA in the genome is neither protein coding nor regulatory. This is part of why molecular genetics is so tricky: it is hard to find the important parts among all the rest. Researchers have become much better at sifting through the noncoding parts of the genome to find the sequences that are interesting and useful. Think of lots of tricky puzzles being solved, rather than of a paradigm being overthrown by revolution.


Carey, Nessa. (2015) Junk DNA: A Journey Through the Dark Matter of the Genome. Icon Books, London.

Doolittle, W. Ford, and Tyler DP Brunet. (2017) ”On causal roles and selected effects: our genome is mostly junk.” BMC Biology.

Boring meta-post of the year

Really, it’s the second boring meta-post of the year, since I’ve already posted this one.

There were some rumours recently that the Scienceblogs blog network would shut down the site. It appears to still be up, and there are still blogs going there, so I don’t know about that, but this reminded me that Scienceblogs existed. I don’t think I’ve read anything on Scienceblogs in years, but it was one of my inspirations when I started blogging. It’s not that I wanted to be a science writer, but Scienceblogs and the also now defunct ResearchBlogging RSS feed (Fausto & al 2012) made me figure out that blogging about science was a thing people did.

Slowly, this thing took shape and became a ”science community blog”, in the terminology of Saunders & al (2017). That is, this blog is not so much about outreach or popular science, but ”aimed at the academic community”. I think of it as part of a conversation about genetics, even if it may be largely a conversation with myself.

So what is the state of the blog now? In September 2016, I decided to try to post once or twice a month (and also to make sure that both posts weren’t pointless filler posts). This panned out pretty well up until October 2017, when I ran out of steam for a while. Probably unrelated to that, 2017 was also the year my blog traffic suddenly increased by more than a factor of two. I don’t know for sure why, but looking at the numbers of individual posts, it seems the increase is because a lot of R users are looking for tidyverse-related things. If I went by viewer statistics, I would post less about genetics and more about hip R packages.

Instead, 2018 I will:

  • Attempt to keep up the pace of writing one or two things every month. Some, but not all, of them will be pointless fillers.
  • Hopefully produce a couple of posts about papers, if those things get out of the pipeline eventually. The problem with this, as anyone who writes papers knows, is that once something is out of the pipeline, one has grown so enormously tired of it.
  • Write a few more posts about other scientific papers I read. I’ve heard that there is limited interest in that sorts of thing, but I enjoy it, and writing should make me think harder about what I read.