Hoppa till huvudinnehåll

Aktuellt från Språkbanken

Blogg (Svenska)

Structural markup of Swedish newspapers

Newspapers contain complex layout and content structure. While layout refers to margins, white spaces, columns, placement of headings etc, content refers to the information inside a paragraph such as type of content in the paragraph, is it enumeration, bullet lists, addresses, etc.

Blogg (Svenska)

Flerordingar: ord som består av flera delar

När vi tänker på ord så tänker vi oftast på enheter som i text omges av blanksteg (mellanrum): 'huset', 'superstor', 'bloggade'. De flesta skulle nog säga att 'idag' är ett ord, men hur är det om vi skriver det (också rättstavat) 'i dag' då? 'Mont Blanc-tunneln'? 'Röda blodkroppar'?

Blogg (Svenska)

How reliable is sense disambiguation in texts by native and non-native speakers?

(This blog is based on a joint research and publication in collaboration with David Alfter, Therese Lindström Tiedemann, Maisa Lauriala and Daniela Piipponen)

Nyhet (Svenska)

Så kan språkteknologi stärka små språk

I slutet av augusti arrangerade Isof med hjälp av Språkbanken Sam en digital heldag med föreläsningar om språkteknologi och dess betydelse för de små språkens bevarande och utveckling. Nu kan du ta del av föreläsningarna i efterhand.
Blogg (Svenska)

Grierson’s “Linguistic Survey of India” as open-access digital data resource for studying languages of South Asia

Lars Borin, Anju Saxena, Shafqat Mumtaz Virk, Bernard Comrie

Nyhet (Svenska)

Projekt om svenska språkmodeller får forskningmedel

Språkbanken Text har tillsammans med Kungliga Biblioteket, forskningsinstitutet RISE och AI Innovation of Sweden beviljats medel från Vinnova för projektet "SuperLim: en svensk testmängd för språkmodeller".
Nyhet (Svenska)

Snart premiär för ny svensk korpus

Svenskan har länge saknat en diakronisk korpus, det vill säga en digitaliserad samling texter som sträcker sig över lång tid. Men nu arbetar Eva Pettersson, datorlingvist vid Uppsala universitet, med att ta fram en textsamling på flera miljarder ord som kommer röra sig från fornsvenska till nutid.
Nyhet (Svenska)

Språkbanken bidrar till nya sätt att tillgängliggöra KB:s samlingar

Tillsammans med Kungliga bibliotekets nystartade datalabb kommer Språkbanken Text att bidra till att tillgängliggöra delar av KB:s samlingar. – Samarbetet innebär mycket goda nyheter för digital humaniora och samhällsforskning i Sverige, säger Love Börjesson, verksamhetsledare för KB-labb.
Nyhet (Svenska)

Spana i dialektkartan!

Från och med 2020 får fler personer tillgång till röstmaterial från Isofs samlingar, i och med lanseringen av Dialektkartan.
Blogg (Svenska)

En syntaktisk beskrivningsmodell för modern svensk text

Sverige har en relativt lång tradition av att skapa en typ av korpus som brukar kallas trädbank. En trädbank är en samling texter som har annoterats (märkts upp) med ordklasser och syntaktisk struktur. Den syntaktiska strukturen för en mening kan ritas upp så att den liknar ett träd.

Blogg (Svenska)

Korp searches in Second Language data

Korp offers a lot of different corpus collections for various types of search (and research). Swedish as a Second Language (L2) is one of the subcategories of the language that can be studied with the help of Korp. At the moment, Korp provides access to five L2 corpora through its interface:

Blogg (Svenska)

The five lives of Talbanken

This post is about Talbanken, one of the most widely used and important Swedish corpora. There exist at least five versions of this treebank, and the purpose of this post is to reduce ambiguity of the name "Talbanken", which sometimes leads to confusion.

Blogg (Svenska)

Om ordklasser för svenska språket

Ordklassindelning används i många språkteknologiska verktyg därför att det är ett sätt att skilja mellan olika användningar av ett ord. Genom ordklasserna kan man enklare söka efter liknande ord och uttryck i stora textmängder, eller skapa en ny text med liknande form.

Blogg (Svenska)

En topic modell bland andra – En data-intensiv forskningsmetodologi 3

I det första avsnittet av denna bloggserie pratade vi om den data-intensiva forskningsmetodologin och gav en övergripande bild.

Blogg (Svenska)

Text som forskningsdata – En data-intensiv forskningsmetodologi 2

Detta blogginlägg är en uppföljning av ett tidigare som inleds med en beskrivning av en data-intensiv forskningsmetodologi, börja gärna med den.

Blogg (Svenska)

Common Pitfalls in the Development of ICALL Applications

This blog is a piece of opinion where I sketch the process of developing NLP-based applications for second language learning and look at the process from the point of view of typical (mis)conceptions and challenges, as I have experienced them. Are we over-trusting the potential of NLP?

Blogg (Svenska)

En data-intensiv forskningsmetodologi 1

I en värld där AI tar en allt större plats har datadriven forskning blivit orden på allas läppar. I det här blogginlägget tänkte jag prata lite om vad det innebär att forska med hjälp av stora mängder textdata, primärt inom humaniora.

Blogg (Svenska)

A multilingual annotated corpus of world's natural language descriptions

Shafqat Mumtaz Virk, Harald Hammarström, Markus Forsberg, Søren Wichmann

Blogg (Svenska)

Zipfs lag på svenska

Zipfs lag, uppkallad efter den amerikanske lingvisten George Kingsley Zipf, säger att ett ords frekvens är omvänt proportionellt mot dess plats i en frekvenslista. Vad innebär det?

Blogg (Svenska)

Meaning through sensory data

Recently, we have seen a surge of methods that claim to embed meaning from textual corpora. But is that possible? Can text really reveal meaning, and if so, can current NLP methods detect it? Can our methods, as they some times claim, understand?