SwePub
Sök i LIBRIS databas

  Utökad sökning

id:"swepub:oai:DiVA.org:su-177196"
 

Sökning: id:"swepub:oai:DiVA.org:su-177196" > Building a De-ident...

Building a De-identification System for Real Swedish Clinical Text Using Pseudonymised Clinical Text

Berg, Hanna (författare)
Stockholms universitet,Institutionen för data- och systemvetenskap
Taridzo, Chomutare (författare)
Dalianis, Hercules (författare)
Stockholms universitet,Institutionen för data- och systemvetenskap
 (creator_code:org_t)
Association for Computational Linguistics, 2019
2019
Engelska.
Ingår i: Proceedings of the Tenth International Workshop on Health Text Mining and Information Analysis (LOUHI 2019). - : Association for Computational Linguistics. - 9781950737772 ; , s. 118-125
  • Konferensbidrag (refereegranskat)
Abstract Ämnesord
Stäng  
  • This article presents experiments with pseudonymised Swedish clinical text used as training data to de-identify real clinical text with the future aim to transfer non-sensitive training data to other hospitals. Conditional Random Fields (CFR) and Long Short-Term Memory (LSTM) machine learning algorithms were used to train de-identification models. The two models were trained on pseudonymised data and evaluated on real data. For benchmarking, models were also trained on real data, and evaluated on real data as well as trained on pseudonymised data and evaluated on pseudonymised data. CRF showed better performance for some PHI information like Date Part, First Name and Last Name; consistent with some reports in the literature. In contrast, poor performances on Location and Health Care Unit information were noted, partially due to the constrained vocabulary in the pseudonymised training data. It is concluded that it is possible to train transferable models based on pseudonymised Swedish clinical data, but even small narrative and distributional variation could negatively impact performance.

Ämnesord

NATURVETENSKAP  -- Data- och informationsvetenskap -- Systemvetenskap, informationssystem och informatik (hsv//swe)
NATURAL SCIENCES  -- Computer and Information Sciences -- Information Systems (hsv//eng)

Nyckelord

de-identification
electronic health records
machine learning
Swedish
Computer and Systems Sciences
data- och systemvetenskap

Publikations- och innehållstyp

ref (ämneskategori)
kon (ämneskategori)

Hitta via bibliotek

Till lärosätets databas

Sök utanför SwePub

Kungliga biblioteket hanterar dina personuppgifter i enlighet med EU:s dataskyddsförordning (2018), GDPR. Läs mer om hur det funkar här.
Så här hanterar KB dina uppgifter vid användning av denna tjänst.

 
pil uppåt Stäng

Kopiera och spara länken för att återkomma till aktuell vy