För att blockera smärtan efter till exempel en höftfraktur måste narkosläkare hitta rätt nerv i ljumsken. En ny studie från Lunds universitet har mätt en AI-modell mot nio läkares samlade bedömning. AI:n presterade i nivå med de skickligaste läkarna.
– Men vårt viktigaste bidrag är själva metoden för att göra jämförelsen, säger docent Pether Jildenstål, en av forskarna bakom studien.

Femoralisblockad är en av de vanligaste bedövningsteknikerna i akut- och ortopedisk vård. En liten mängd lokalbedövning läggs intill lårbensnerven i ljumsken och stänger av smärtsignalerna från benet, vilket minskar behovet av morfin hos framför allt äldre patienter med höftfraktur.

– På ultraljudsbilden syns nerven som en oregelbunden ljus struktur bredvid lårbensartären. Det är svårt att avgöra exakt var den börjar och slutar, vilket kan vara en tolkningsfråga även bland erfarna läkare, säger Johan Berggreen, anestesisjuksköterska och doktorand vid Lunds universitet.
Därför, konstaterade forskarna, räcker det inte att som i tidigare studier jämföra AI mot en enda läkares uppfattning. Forskargruppen samlade in 100 ultraljudsbilder av ljumsken. Sju ST-läkare i anestesi och två specialister med mer än tio års erfarenhet fick oberoende av varandra och utan att se varandras svar rita in lårbensnerven på varje bild. Det gav 900 markeringar. Där en majoritet av läkarna var överens skapades en gemensam referensbild, studiens facit.
AI minst lika bra
Mot detta facit mättes sedan både AI-modellen och varje enskild läkare. AI:n matchade den genomsnittliga läkaren i gruppen och var bättre än fem av de nio. Modellen hittade nästan alltid nerven, men markerade ofta ett något större område än nödvändigt. Ett väl tilltaget område är i sammanhanget bättre eftersom det annars finns risk att en del av nerven missas helt. Men läkaren behöver fortfarande granska förslaget innan det används på en patient, betonar forskarna.
Det mest speciella med studien är enligt dem inte AI-modellen i sig, utan att forskargruppen tagit fram ett sätt att mäta medicinsk AI mot vad människor faktiskt presterar.
– Utan en mänsklig referens vet vi inte om en låg siffra betyder att AI:n är svag eller att uppgiften i sig är svår. Det är därför vi menar att AI bör mätas mot hur läkare faktiskt bedömer bilderna, inte mot tröskelvärden som satts på teknisk grund, säger Johan Berggreen.
Metoden har generell tillämpning

Metoden kan enligt forskarna nyttjas inom vilken annan forskning som helst som använder sig av bildtolkande AI-system där det inte finns ett på förhand givet rätt svar. De hoppas att andra forskargrupper blir sporrade till att använda metoden.
– Styrkan är att vi vet exakt vilka data som gått in i modellen, hur den tränats och vad den kan användas för. Den öppenheten går sällan att få hos kommersiella system, och den var en förutsättning för att kunna utveckla och pröva själva metoden. Och eftersom vi byggt modellen själva, kan den tränas om för andra strukturer och bildtyper, säger Pether Jildenstål.
Forskarnas nästa steg är att pröva metoden i realtid, under pågående ultraljudsundersökning, i stället för på stillbilder.
Text: ERIKA SVANTESSON
Artikeln är tidigare publicerad som nyhet från Lunds universitet

