In Michelangelo’s depiction of Moses, a marble statue commissioned by Julius II, we can see that Moses has horns.But why does Moses have horns?
Blog
Blog
Niklas Zechner
Jupiter Descending
Those of you who are interested in astronomy may have noticed that you can currently see Jupiter in the night sky. Jupiter is in opposition (with the sun) – in other words, it's on the opposite side of us from the sun. That makes it easier to see, for a couple of reasons.
Blog
Niklas Zechner
Vilket ord är bäst?
I förra blogginlägget fick vi läsa om korsord, en populär sysselsättning så här under sommarmånaderna. En relaterad hobby om man vill vara lite mer social är förstås att spela Scrabble – även känt under det svenska namnet Alfapet, samt i olika digitala versioner, bland annat Wordfeud.
Blog
Aleksandrs (Sasha) Berdicevskis
Documentation: a (fictional) sad story with a (real) happy ending
This post is based on joint work with Gerlof Bouma. Illustrations by Jan and Julija.Here's a sad story (it's fictional, but sad nonetheless).
Blog
Elena Volodina
Swedish derivational morphology with CoDeRooMor
This blog is based on a joint work by Elena Volodina, Therese Lindström Tiedemann and Yousuf Ali Mohammed within the RJ-funded project L2 profiles.
Blog
Dimitrios Kokkinakis
A Swedish COVID-19 (sv-COVID-19) corpus and its exploration ... smorgasbord
As the COVID-19 virus became a pandemic in March 2020, the amount of (time-stamped written) data, such as news/newspaper reports, scientific articles, social media posts (e.g.
Blog
Yvonne Adesam
The SwedishGLUE project
Artificial intelligence system dealing with (human) natural language rely on language models, predictions of which words occur together. To better understand how such models work -- and where they fail -- when applied to Swedish texts we need Swedish test data.
Blog
Peter Ljunglöf
Reflektioner från SLTC 2020
25-27 november gick den åttonde upplagan av SLTC, Swedish Language Technology Conference, av stapeln på Humanisten här i Göteborg. Eller, skulle ha gjort om inte ett visst virus satte stopp för det.
Blog
Aleksandrs (Sasha) Berdicevskis
How native and non-native speakers talk to each other
We at Språkbanken Text have just released a new corpus of native (L1) and non-native (L2) speech in four languages: English, Spanish, French and Italian.
Blog
Elena Volodina
Pseudonymization of learner essays as a way to meet GDPR requirements
This blog is based on the author's (Elena Volodina's) joint research with Yousuf (Samir) Ali Mohammed, Arild Matsson, Beáta Megyesi and Sandra Derbring
Blog
Dana Dannélls
Structural markup of Swedish newspapers
Newspapers contain complex layout and content structure. While layout refers to margins, white spaces, columns, placement of headings etc, content refers to the information inside a paragraph such as type of content in the paragraph, is it enumeration, bullet lists, addresses, etc.
Blog
Yvonne Adesam
Flerordingar: ord som består av flera delar
När vi tänker på ord så tänker vi oftast på enheter som i text omges av blanksteg (mellanrum): 'huset', 'superstor', 'bloggade'. De flesta skulle nog säga att 'idag' är ett ord, men hur är det om vi skriver det (också rättstavat) 'i dag' då? 'Mont Blanc-tunneln'? 'Röda blodkroppar'?
Blog
Elena Volodina
How reliable is sense disambiguation in texts by native and non-native speakers?
(This blog is based on a joint research and publication in collaboration with David Alfter, Therese Lindström Tiedemann, Maisa Lauriala and Daniela Piipponen)
Blog
Lars Borin
Grierson’s “Linguistic Survey of India” as open-access digital data resource for studying languages of South Asia
Lars Borin, Anju Saxena, Shafqat Mumtaz Virk, Bernard Comrie
Blog
Yvonne Adesam
En syntaktisk beskrivningsmodell för modern svensk text
Sverige har en relativt lång tradition av att skapa en typ av korpus som brukar kallas trädbank. En trädbank är en samling texter som har annoterats (märkts upp) med ordklasser och syntaktisk struktur. Den syntaktiska strukturen för en mening kan ritas upp så att den liknar ett träd.
Blog
Elena Volodina
Korp searches in Second Language data
Korp offers a lot of different corpus collections for various types of search (and research). Swedish as a Second Language (L2) is one of the subcategories of the language that can be studied with the help of Korp. At the moment, Korp provides access to five L2 corpora through its interface:
Blog
Aleksandrs (Sasha) Berdicevskis
The five lives of Talbanken
This post is about Talbanken, one of the most widely used and important Swedish corpora. There exist at least five versions of this treebank, and the purpose of this post is to reduce ambiguity of the name "Talbanken", which sometimes leads to confusion.
Blog
Yvonne Adesam
Om ordklasser för svenska språket
Ordklassindelning används i många språkteknologiska verktyg därför att det är ett sätt att skilja mellan olika användningar av ett ord. Genom ordklasserna kan man enklare söka efter liknande ord och uttryck i stora textmängder, eller skapa en ny text med liknande form.
Blog
Nina Tahmasebi
En topic modell bland andra – En data-intensiv forskningsmetodologi 3
I det första avsnittet av denna bloggserie pratade vi om den data-intensiva forskningsmetodologin och gav en övergripande bild.