scieee AI-readable full text Open interactive document viewer

Journalistisen tiedonhankinnan tehostaminen tekstianalyysityökaluilla: Tutkimushankkeen loppuraportti ja ohjelmistoarvioinnit toimituskäyttöön

Mykkänen, Markus,Koski, Aleksi

Full text

Markus Mykkänen & Aleksi Koski JOURNALISTISEN TIEDONHANKINNAN TEHOSTAMINEN TEKSTIANALYYSITYÖKALUILLA Tutkimushankkeen loppuraportti ja ohjelmistoarvioinnit toimituskäyttöön JYU REPORTS 15 JYVÄSKYLÄ 2022 2 Copyright © 2022, by University of Jyväskylä Permanent link to this publication: http://urn.fi/URN:ISBN: 978-951-39-9432-7 ISBN (PDF) 978-951-39-9432-7 URN:ISBN:978-951-39-9432-7 ISSN 2737-0046 DOI: 10.17011/jyureports/2022/15 This work is licensed under a Creative Commons Attribution 4.0 International license (CC BY 4.0). 3 Esipuhe ............................................................................................................................. 4 1 Tausta ..................................................................................................................... 5 Tutkimuksen menetelmät .................................................................................. 6 Tutkimuksen kulku .............................................................................................. 8 2 Tulokset .............................................................................................................. 10 Voyant Tools ........................................................................................... 13 Wordsmith ............................................................................................... 14 AntConc .................................................................................................... 16 Overview .................................................................................................. 17 Lähteet .......................................................................................................................... 20 Kirjoittajat ..................................................................................................................... 23 4 Journalisteilla voi uutistyön taustalla olla toisinaan suuri aineisto. Taustamateriaalit voivat käsittää jopa tuhansia sivuja kymmenistä eri lähteistä. Toimittajille voi olla haastavaa tai ylivoimaista nähdä aineistosta, mikä olisi mielenkiintoisinta tai uutisen arvoista. Eri alojen tutkijat ovat luoneet monenlaisia tekstin louhinta-, laskentaja analyysiohjelmia tutkimustyöhön isojen asiakirja-aineistojen läpikäymiseen. Heillä on näihin perinpohjaisia lähestymistapoja, joilla saa aikaiseksi vankasti perusteltuja tutkimustuloksia. Toimittajien tiedontarpeet ovat kuitenkin erilaisia. Yksittäisistä uutiskriteerit täyttävistä löydöistä voi uutisoida välittömästi löydön jälkeen. Aineistoon voi palata uudestaan myöhemmin kattavampaa tarkastelua varten. Toimittaja voi käyttää omiin aineistoihinsa tutkijoiden ohjelmia ja löytää helmiä muutamalla klikkauksella. Tässä hankkeessa etsittiin ratkaisuja tähän ongelmaan eli kuinka nopeasti selata läpi aineisto ja löytää uutisarvoinen tieto? Mikä on paras työväline tähän? Markus Mykkänen ja Aleksi Koski 5 Toimitukset laativat uutiset oman tiedonhankinnan pohjalta. Tavallisesti journalistin tärkein resurssi on aika. Useimmilla journalisteilla ei ole erityiskoulutusta tiedonhankintaan tai informaatioteknologiaan, eikä heillä ole rahaa tai aikaa paneutua asiaan. Tietoa halutaan mahdollisimman runsaasti ja hyödynnettäväksi valitaan usein ensimmäiseksi kohdalle osuva, riittävän uutisarvoiseksi koettu tieto. Syynä tähän ovat erityisesti journalististen medioiden kustannuspaineet. (Attfield & Dowell, 2003; Cambell 1997; Hopeakunnas 2015) Journalistisia tiedonhankintavälineitä ovat esimerkiksi aiemmin julkaistut tiedot (uutiset ja tiedotteet), julkaisemattomat viranomaisasiakirjat sekä suorat henkilölähteet eli haastattelut. Erityisesti tutkiva journalismi edellyttää perinpohjaista perehtymistä asiakirjalähteisiin. Niistä voi löytyä tietoja, joita viranomainen pyrkii piilottamaan tai joilla voi esimerkiksi tarkastaa ja kumota virkamiesten tai poliitikkojen haastatteluissa esittämät väitteet. Viranomaisten asiakirjatiedot paljastavat sitä, mitä viranomaiset tekevät, sen sijaan mitä he haluaisivat kertoa tekevänsä. (Houston & IRE, 2008). Toimittajien syyt olla käyttämättä asiakirjalähteitä liittyvät tavallisesti aikaan: asiakirjojen saaminen vie aikaa, niiden läpikäyminen vie aikaa, eikä ole takeita, että niistä löytyy uutista. Moni toimittaja käyttää vain tiedoteaineistoa ja haastatteluja, koska ne riittävät uutisia varten. Henkilölähteet voivat kuitenkin antaa haastatteluja myös muille medioille ja myös tiedotteet lähetetään kaikille medioille. Useat viime aikojen valtakunnallisista skuupeista pohjaavatkin asiakirjatietoihin, joiden kaivelemiseen muut mediat eivät ole käyttäneet aikaa (esimerkiksi Harjumaa & Jansson, 2020; Paananen & Liski, 2020; Rämö & Liski 2018). 6 Tiedonhankinta asiakirjoista käsittää useita huomioitavia seikkoja: lähteiden etsimisen, tiedon hankinnan tietokannoista tai tietopyynnöillä viranomaislähteistä, sekä käsittelyn, lukemisen ja läpikäymisen. Viranomaisten asiakirjatietojen tiedonhankinnasta on ollut Jyväskylän yliopistossa erilaisia tutkimushankkeita aiempina vuosina. (julkisuuslaki.fi) Asiakirjojen käsittelyyn on olemassa koneavusteisia lähestymistapoja, kuten erilaiset algoritmit, koneoppiminen ja scraping-tekniikat. Näistä useimmat edellyttävät ohjelmointiosaamista, jota lähtökohtaisesti useimmilla toimittajilla ei ole. Moni menetelmä edellyttää joko lingvistiikan tai tietotekniikan syventävää opiskelua. Ei voida olettaa kiireisen journalistin ryhtyvän vuosien opiskelu-urakkaan käyttääkseen uutta tiedonhankintametodia (Bednarek & Carr, 2020; De Grove, Boghe & De Marez, 2020; Hase, Engelke & Kieslich, 2020; Su, Hu & Lee, 2020; Heyl, Joubert & Guenther, 2020). Toimittajien hyödynnettävissä on myös korpuslingvistiikan kentältä peräisin olevia tekstianalyysityökaluja, joiden käyttö on nopeaa, helppoa ja intuitiivista. Toimitusten ja toimittajien tekstianalyysityökalujen käyttöönottoa voidaan edistää lyhyillä, muutaman minuutin screencast-opasvideoilla, joilla opastetaan ohjelmien ja niiden ominaisuuksien käyttöä. Koneavusteisen tekstianalyysin tutkiminen osana journalistista työprosessia on vielä uutta. Eri tutkijat ovat käyttäneet hyvin erilaisia välineitä ja menetelmiä, eikä ole täysin ilmeistä, mitä kaikkea näillä uusilla välineillä voisi tehdä. Toimituksiin tarvitaan menetelmien yleistajuista tietoa ja osaamista. (Bednarek & Carr, 2020; De Grove, Boghe & De Marez, 2020). Tämä tutkimus toteutettiin 1.9.2021–31.8.2022 osapäiväisenä tutkimusja kehitystyönä. Hankkeen alussa kirjallisuuskatsauksella selvitettiin journalistisessa tutkimuksessa hyödynnetyt tekstianalyysiohjelmat ja -menetelmät. Näistä valittiin vertailuun sellaiset, jotka vastasivat journalistisen työn ominaisuuksia, tavoitteita ja reunaehtoja. Kirjallisuuskatsauksen myötä tarkentuivat myös ohjelmistojen arvioinnin kriteeristöt. Journalismin ideologisista kriteereistä huomioitaviksi tulivat riippumattomuuden, objektiivisuuteen pyrkimisen, lähdesuojan sekä tietosuojan kysymykset (Deuze, 2005; Pöyhtäri, Väliverronen & Ahva 2016): 7 • Ohjelman on oltava mielellään maksuton tai hyvin edullinen. Tämä vaatimus karsi eniten erilaisia ohjelmia. • Toimittajien on aina kyettävä pysymään perillä siitä, mitä he ovat tehneet ja miksi. Mahdollisimman vähän tapahtuu piilossa ohjelman sisällä. Kirjallisuuskatsauksessa erottui erilaiset algoritmeihin ja esimerkiksi koneoppimiseen painottuvat lähestymistavat, jotka karsittiin tästä tutkimuksesta pois: Tällaisten ohjelmien käyttö ilman käsitystä siitä miten ohjelmat tuloksensa saavat aikaiseksi voisi olla epäeettinen lähestymistapa. • Ohjelman on oltava täysin toimittajan hallinnassa tämän omilla laitteilla, eikä yhteydessä pilvipalveluun jonne tiedot ovat vaarassa latautua. Erityisesti moni uudempi niin sanottua ”big datan” tutkimusta mahdollistava lähestymistapa karsiutui tätä myötä pois. Toisaalta tällaiset vaikuttivat edellyttävän syötetyltä datalta puhtautta ja yhdenmukaisuutta rakenteen kannalta, joka ei jokapäiväisessä uutistyössä ole mahdollista. Journalismin ideologinen vaatimus on myös ajankohtaisuus eli uutisia on kyettävä tuottamaan päivänpolttavista asioista nopeasti. Tästä tavoitteesta syntyy keskeisiä käytännöllisiä reunaehtoja ohjelmien käytölle, koska keskeisin resurssi on aika. Toimittajien aiemman koulutuksen ja osaamisen puute karsi tehokkaasti esimerkiksi koodausta tai erityiskoulutusta edellyttäviä ohjelmia. Käytännössä jäljelle jää vahvasti visuaaliset käyttöliittymät, joissa on varsin yksinkertaiset toiminnot. Käytännön journalistisen työn vaatimuksia olivat siis (muun muassa Brehmer ym., 2014 ja Liu ym., 2013 pohjalta): • Ohjelmien käynnistyksen ja käytön on oltava nopeaa ja sujuvaa, • Ohjelman on oltava visuaalinen ja helppokäyttöinen, eikä vaadi merkittävää ennakko-opettelua, • Ohjelman on tuettava mahdollisimman laajaa skaalaa eri tiedostomuotoja, joita on voitava ladata ohjelmaan kerralla massoittain (robust import). • Ohjelman on voitava käsitellä hyvinkin “likaista dataa”, eli sotkuista ja rakentumatonta tietoa (robust analysis). • Luvut ja lukumäärät ovat raportoinnissa tärkeitä, näiden tuottaminen eri tavoin ja vaivattomasti on keskeistä. • On tärkeää, että aineistoon voi vaivattomasti käydä käsiksi ja esimerkiksi tunnistaa, poimia ja lukea yksittäisiä asiakirjoja sekä tehdä niihin 8 tunnistamista helpottavia muistiinpanoja. Siirtymisen eri näkymien osalta täytyy olla siis selkeää ja nopeaa. Valitun näkökulman oli tarkoitus vastata mahdollisten rivitoimittajien osaamistasoa. Vertailusta luodusta raportista sekä ohjelmien arvosteluista journalistit voivat arvioida nykyisten tekstianalyysiohjelmien käyttökelpoisuutta työssään. Tämän lisäksi toimittajille laadittiin opas ja screencast-videoita rivitoimittajan tarpeille parhaaksi valikoidusta ohjelmasta. Hanke lähti liikkeelle vertaisarvioidusta tutkimusartikkelista (Bednarek & Carr 2020), jossa esiteltiin tekstianalyysiohjelmia tiedonhankintamenetelmänä. Hankkeen aluksi toteutettiin kirjallisuuskatsaus, jota ohjasivat seuraavat tutkimuskysymykset: • Millaisia tekstianalyysityökaluja journalismin tutkimuksessa on käytetty? • Millaisin menetelmin näitä työkaluja on käytetty? Kirjallisuuskatsaus tuotti hakukriteerien pohjalta joko hyvin suppean tai liian laajan tuloksen: lähestymistapa on journalistiikan tutkimuksessa hyvin uusi, ja useiden tieteenalojen alalta ohjelmien käyttö on kirjavaa. Ohjelmien käyttö tutkimuksessa ja erityisesti näiden raportointi on hyvin vaihtelevaa. Kirjallisuuskatsausta laajennettiin ns. snowballing-menetelmällä seuraten katsauksessa löydetyn kirjallisuuden viittauksia sekä kirjallisuuteen viitannutta uutta kirjallisuutta. Kirjallisuutta, menetelmiä ja työkaluja kerättiin taulukkoon. Tutkimushankkeen näkökulmaa rajasi edeltävässä luvussa esitelty journalistisen työn näkökulma sekä alkuperäisen artikkelin laskennallinen ja nopeaan hakuun ja tekstimassojen laskennalliseen analyysiin perustunut lähestymistapa. Tämä rajasi tutkijoiden hakemien ohjelmien vaatimuksia ja ominaisuuksia. Valikoituneissa tutkimusartikkeleissa mainitut ohjelmat ovat pääsääntöisesti korpuslingvistiikkaa varten alun perin kehitettyjä. Valitsemamme ohjelmat ovat myös lähteiden valossa yleisimmin maailmalla tarkoitukseensa käytettyjä. Vähemmän käytetyistä ohjelmista ei löytynyt kilpaili- 15 WordSmithin voi ladata osoitteesta https://www.lexically.net/wordsmith/downloads/. WordSmith 5.0 versioon on asennuslinkki sekä ilmaisen rekisteröimisavaimen tiedot osoitteessa https://lexically.net/wordsmith/version5/. Lataus sekä asennus on helppoa ja nopeaa, ohjelma toimii itsenäisesti kotikoneella eikä ole yhteydessä verkkoon. Wordsmithin käyttö on selkeää ja perusnäkymä on yksinkertainen. Wordsmithin ytimessä on kolme ohjelmaa: WordList, joka laskee sanat aineistosta, KeyWords, joka vertaa aineistoa suurempaan vastaavaa kieltä olevaan tekstiaineistoon, sekä Concord, joka tekee valituista sanoista konkordanssihaun. Ohjelman suurimpia huonoja puolia on eri tiedostomuotojen tuen puute. Ohjelma edellyttää aineiston muutamista tekstitiedostoiksi (.txt ). Se onnistuu helpoiten esimerkiksi massakonversio-ohjelmalla, kuten Xpdfreader tools, joka osaa muuttaa myös kuvia tekstiksi (OCR). Tehdasasetukset ovat hyvät sanalistojen tekemiseen ja konkordanssiin. Asetukset ovat englanninkieliset, mutta sieltä kannattaa vaihtaa päälle suomen kielen tuki. Avainsanojen etsiminen edellyttää verrokiksi suurempaa tekstiaineistoa, korpusta. Tämän tekstiaineiston pitäisi olla samantyylistä tekstiä kuin tutkittava aineisto. Wordsmithin valmistanut yritys Lexically viittaa itse sivuillaan tutkimukseen, jonka mukaan viisi kertaa suurempi aineisto on riittävä verrokkiaineisto avainsanojen etsimistä varten. Konkordanssihaku toimii nopeasti ja sujuvasti. Mutta haun huono puoli on monipuolisuuden puute: erilaisia näkymiä ja varsinkin visuaalisia työkaluja puuttuu. Tutkijoiden kannalta Wordsmithin etuna on se, että sitä on käytetty paljon erilaisessa tutkimuksessa, joten siitä löytyy menetelmällistä kirjallisuutta ja vertaisarvioituja lähteitä. Lisäksi jos toiminnan tavoitteet ovat selkeät, tarkoitus on laskea sanoja ja tehdä konkordanssihakua, on Wordsmith oiva työkalu. Asetuksia voi säädellä melko monipuolisesti ja ne säilyvät omalla koneella tallessa seuraavaa käyttöä varten. Wordsmith on tavallinen tietokoneohjelma, josta saa pikakuvakkeen työpöydälle. Se on siis luonteeltaan Voyant toolsia aavistuksen yksinkertaisempi käynnistää. Siitä kuitenkin puuttuu erityisesti visuaalisia näkymiä ja 16 myös Voyant tools on helppokäyttöinen, sekä siihen voi syöttää monipuolisempia erilaisia tiedostomuotoja. PERUSINFO: Kehittäjä: Lexical Analysis Software Ltd Julkaisuvuosi: alkujaan 1996 Kehitysvaihe: uusin versio 8.0 päivitetään edelleen - uusia ominaisuuksia tulee sekä yhteensopivuutta uusiin käyttöjärjestelmiin ylläpidetään. Hinta: versiot 5.0 ja 4.0 ilmaiset, 50 puntaa kappale Laitevaatimukset: 5.0: 512 MB keskusmuistia, 40 Mb kovalevytilaa. 8.0: 1GB keskusmuistia, 100 Mb kovalevytilaa. Käyttöjärjestelmätuki: Windows Mobiilituki: Ei AntConc on korpusanalyysityökalupakki konkordanssihakuja ja tekstianalyysiä varten. Kuten Wordsmith, myös Antconc on ollut kattavasti käytettynä maailmalla. Antconc on freewarepohjalta pääasiassa yhden tutkijan varassa kehitelty ohjelma. AntConcissa on useampi erilainen työkalu Wordsmith 5.0:an verrattuna. AntConcin lataus ja käyttö on näistä arvosteltavista ohjelmista perinteisin ja selkein omalla koneella: koneelle ladataan asennustiedosto ja sitten ohjelma avataan koneella kuin mikä tahansa muu ohjelma. Voyant Toolsiin verrattuna AntConc on kulmikkaampi ja teknisempi: sen käytössä ei heti avaudu intuitiivisia ikkunoita, vaan toiminnot ovat usein kielentutkijoiden ammattikielellä nimettyjen valikoiden takana. Käyttäjän pitää tietää etukäteen mikä kukin työkalu on ja mitä se tekee. Lisäksi käyttöjärjestelmässä on avoinna yksi työkalu kerrallaan, mistä suurimpana miinuksena on se, että yksittäistä asiakirjaa tarkistellessa muut näkymät ovat poissa näytöltä. Ohjelma edellyttää siis vähän perehtymistä ja opettelua. Voyant Tools avaa eri näkymiä heti rinnakkain ja niistä useimmista näkee päälle päin heti mistä on kyse – mikä on visuaalinen apuväline, mikä varsinainen haku ja niin edelleen. AntConc on hyvin monipuolinen ja sitä voi säätää asetuksista monella eri tavalla itselleen mieleiseksi. Tämä on toki myös heikkous, koska toimintojen monipuolisuus ja ylenmääräinen teknisyys eivät välttämättä ole toimittajalle hyveitä. Toisin kuin Wordsmithin uusimmat versiot, AntConc on täysin 17 ilmainen (freeware) yksityiseen käyttöön. Sen sijaan yrityksien pitäisi maksaa käyttäjäkohtainen lisenssimaksu. Siksi se saattaa olla hankala käytännössä esimerkiksi mediataloille. Freelance-toimittajalla ei pitäisi olla ongelmaa. Mikäli toimittajalla on aikaa ja halua perehtyä ohjelmaan ja sen ominaisuuksiin, voi AntConc olla tehokas apuväline. Sitä kun voi räätälöidä mieleisekseen ja säädöt pysyvät tallessa ensi kertaa varten. Projektejaan voi tallentaa ja jatkaa seuraavalla kerralla, eli isommissa tutkivissa hankkeissa tästä voi olla ajan mittaan suurempi hyöty kuin Voyant Toolsista. Sen sijaan perustoimittajan perustyöhön siinä on liian suuri oppimiskynnys. Voyant Tools on nopeampi omaksua ja käyttää. PERUSINFO: Kehittäjä: Anthony Laurence Julkaisuvuosi: 2002 Kehitysvaihe: valmis, päivitetään mikäli yhteensovitusongelmia uusilla käyttöjärjestelmillä Hinta: Maksuton Laitevaatimukset: Keskusmuistia käyttää paljon - mitä enemmän aineistoa, sitä kovemmat vaatimukset Käyttöjärjestelmätuki: Windows, Mac, Linux Mobiilituki: Ei ole Overview on varta vasten journalistista tiedonhankintaa varten tutkimushankkeiden pohjalta luotu tekstinlouhintaeli hakuja tekstianalyysiohjelma. Toimittajille räätälöinnin vuoksi ohjelma on kiinnostava. Ohjelman luoneet tutkijat ovat kirjoittaneet myös hyödyllisiä tutkimusartikkeleja ja muita julkaisuja, joissa läpikäydään toimittajien kannalta olennaisia asioita tämänkaltaisille ohjelmille. Ohjelmassa onkin toimittajan työn kannalta selkein käyttöliittymä: lataat aineiston ja sen jälkeen voit valikoiduilla toiminnoilla analysoida aineistoa. Ohjelman näkökulman on yhteyksien hahmottaminen aineistosta. Muista ohjelmista poiketen tutkijat ovat korostaneet visuaalisia hahmotustyökaluja, eli esimerkiksi vesiputousnäkymää valikoitujen asiasanojen jakautumisesta ja ilmenemisestä eri asiakirjoissa. Tutkijat ovat myös pitäneet tärkeänä toimittajien mahdollisuutta merkitä omia avainsanoja asiakirjoihin ("tag"). 18 Valitettavasti tutkimushankkeet ohjelmasta ovat päättyneet, eikä sitä enää jatkokehitetä. Tämä näkyy erityisesti kahdessa asiassa: asentamisen ja käytön vaikeudessa, ominaisuuksien keskittymisessä englanninkieliseen aineistoon sekä heikoissa näkymätuloksissa. Ohjelma kuitenkin olisi unix-ohjelmointia osaavan räätälöitävissä omia tarpeita paremmin palvelevaksi. Overview on ladattavissa ilmaiseksi, joskin ohjelman asentaminen ja käynnistys eivät ole helppoa. Overview:n GitHub -sivuilla on ohjeet muun muassa ohjelman asentamiseksi ja käynnistämiseksi: https://github.com/overview/. Overview on laadittu Unix-pohjaisena. Toimiakseen Applella tai Windowsilla se vaatii Docker-virtuaalityöskentelytilan. Se taas edellyttää tietokoneen emolevyltä virtuaaliympäristön mahdollistavia toiminnallisuuksia. Käytännössä tämä tarkoittaa, että vain osa uusimmista tietokoneista kykenee Dockeria käyttämään (lisätietoja löydät osoitteesta https://docs.docker.com/desktop/windows/install/). Paikallinen asennus avautuu selainpohjaisesti. VoyantToolsiin verrattuna ohjelman käyttö sujuu huomattavasti hitaammin ja vaatii enemmän muistia. Asennettu ohjelma tarjoaa helposti vikailmoituksia palvelinasetuksista ja osa toiminnallisuuksista ei ole heti päällä. Mikäli osaa säätää tietokonettaan ja ymmärtää hieman koodin päälle, ovat nämä ongelmat voitettavissa. Ohjelma käynnistetään lataamalla aineisto ja tämän jälkeen voi valita näkymiä, jotka tarjoavat heti tuloksia muutamalla klikkauksella. Suomenkielisessä aineistossa tulokset vain eivät ole kovin laadukkaita: vaikka ohjelma tunnistaa ruotsin kielen kirjaimet, ei ohjelmaan asennetuista sanakirjaja korpusaineistoista löydy suomenkielistä vaihtoehtoa. Englanninkielisiä sanakirjoja ja tietokantoja hyödyntäen näkymissä on esimerkiksi valmiit pikavalinnat paikkakuntien, yritysten tai henkilöiden etsimiseksi aineistosta. Valitettavasti maailmasta löytyy esimerkiksi niin paljon erinimisiä pikkupaikkakuntia, että hutituloksia tulee runsaasti. Vaikka ohjelman laatineille tutkijoille oli tärkeää, että siihen voi vaivatta syöttää monenlaista aineistoa, oli sitten asiakirjan rakenne tai tiedostotyyppi 19 millainen vain ("robust import”), niin englanninkielinen testiaineisto sisälsi jonkin verran espanjankielistä tekstiä, mikä sotki useita hakutuloksia. Aineisto oli siis liian ”likainen” vierasperäisillä sanoilla. Esimerkki ikävästä pienestä puutteesta on, että erilaiset analyysilistat rakentuvat siten, että näytetään yleisimmät sanat yleisimmästä alkaen. Nämä listat katkeavat tietyssä vaiheessa, jolloin kaikista harvinaisimmat ja usein mielenkiintoiset yksittäiset sanat jäävät kokonaan näkymättä. Itse haku ohjelmassa vaikuttaisi toimivan varsin hyvin – jos tietää, mitä asiasanaa hakee aineistosta, tarjoaa haku asiakirjat ja kohdat. Lisäämällä tageja ja metadataa asiakirjoihin voi luoda esimerkiksi puunäkymän vain näistä tagatuista asiakirjoista. Etuna on, että mikäli unix-taitoja löytyy, voi ohjelmaa itse räätälöidä ohjelmoimalla. Tällöin esimerkiksi eri näkymien järjestyksen muuttaminen sekä valmiiden sanakirja-aineistojen tai ohjelman kirjainmerkkituen lisääminen on mahdollista. Mikäli esimerkiksi datajournalistina harrastaa Linux-pohjaista työskentelyä joka tapauksessa, voi koneelleen räätälöidä itselleen Overviewasennuksen suurten data-aineistojen ensivilkaisua varten. PERUSINFO: Kehittäjä: The Associated Press news agency - Jonathan Stray Julkaisuvuosi: 2011 prototyyppi, selainpohjainen uudelleenjulkaisu 2013 Kehitysvaihe: Päättynyt. Hinta: Ilmainen Laitevaatimukset: Unix-pohjainen kone ei välttämättä vaadi paljon, mutta muilla käyttöjärjestelmillä edellytyksenä on emolevyn virtuaaliympäristötuki (Dockers:a varten) ja paljon muistia (käytännössä melko uusi kone) Käyttöjärjestelmätuki: Unix-pohjainen, vattii Dockers-ympäristön Windows/Apple -koneilla Mobiilituki: Ei ole 20 Ampofo, L., Collister, S., O’Loughlin, B., & Chadwick, A. (2015). Text Mining and Social Media: When Quantitative Meets Qualitative and Software Meets People. In P. Halfpenny & R. Procter, Innovations in Digital Research Methods (pp. 161–192). SAGE Publications Ltd. https://doi.org/10.4135/9781473920651.n8 Attfield, S. & Dowell, J. (2003). Information seeking and use by newspaper journalists. Journal of Documentation, 59(2), 187–204. https://doi.org/10.1108/00220410310463860 Bednarek, M., & Carr, G. (2020). Computer-assisted digital text analysis for journalism and communications research: Introducing corpus linguistic techniques that do not require programming. Media International Australia. https://doi.org/10.1177/1329878X20947124 Brehmer, M., Ingram, S., Stray, J., & Munzner, T. (2014). Overview: The Design, Adoption, and Analysis of a Visual Document Mining Tool for Investigative Journalists. IEEE Transactions on Visualization and Computer Graphics, 20(12), 2271–2280. https://doi.org/10.1109/TVCG.2014.2346431 21 Campbell, F. (1997), "Journalistic construction of news: information gathering", New Library World, Vol. 98 No. 2, pp. 60-64. https://doi.org/10.1108/03074809710159330 De Grove, F., Boghe, K., & De Marez, L. (2020). (What) Can Journalism Studies Learn from Supervised Machine Learning? Journalism Studies, 21(7), 912-927. https://doi.org/10.1080/1461670X.2020.1743737 Deuze, M. (2005). What is journalism?: Professional identity and ideology of journalists reconsidered. Journalism, 6(4), 442–464. https://doi.org/10.1177/1464884905056815 Harjumaa, M. & Jansson, K. (31.8.2020). Bangkok, Kapkaupunki, New York – Virkamatkojen taloudellisuutta valvovan viraston johtaja matkusti viime vuonna 55 000 eurolla. YLE uutiset. https://yle.fi/uutiset/311514399 Hase, V., Engelke, K. M., & Kieslich, K. (2020). The things we fear. combining automated and manual content analysis to uncover themes, topics and threats in fear-related news. Journalism Studies, 21(10), 1384-1402. https://doi.org/10.1080/1461670X.2020.1753092 Heyl, A., Joubert, M., & Guenther, L. (2020). Churnalism and hype in science communication: Comparing university press releases and journalistic articles in south africa. Communicatio. https://doi.org/10.1080/02500167.2020.1789184 Hopeakunnas, M. (2015). Katsaus toimittajien käyttämiin lähteisiin ja tietokäyttäytymiseen. Informaatiotutkimus, 34(1-2). Noudettu osoitteesta https://journal.fi/inf/article/view/53745 Houston, B., Investigative Reporters & Eds. (2008). Investigative Reporter's Handbook: A Guide to Documents, Databases, and Techniques. Bedford/St. Martin's. Viides painos. 22 Jyväskylän yliopisto, Kielija Viestintätieteiden laitos. Julkisuuslaki.fi. Julkisuuslakia ja -periaatetta analysoivat Jyväskylän yliopiston tutkimushankkeet. https://julkisuuslaki.fi Liu, Y., Barlowe, S., Feng, Y., Yang, J., & Jiang, M. (2013). Evaluating exploratory visualization systems: A user study on how clustering-based visualization systems support information seeking from large document collections. Information Visualization, 12(1), 25–43. https://doi.org/10.1177/1473871612459995 Paananen, K. & Liski, J. (2.6.2020). Kallista konsultointia. Suomen Kuvalehti, politiikka. Potts, A., Bednarek, M., & Caple, H. (2015). How can computer-based methods help researchers to investigate news values in large datasets? A corpus linguistic study of the construction of newsworthiness in the reporting on Hurricane Katrina. Discourse & Communication, 9(2), 149– 172. https://doi.org/10.1177/1750481314568548 Pöyhtäri, R., Väliverronen, J., & Ahva, L. (2016). Suomalaisen journalistin itseymmärrys muutosten keskellä. Media & Viestintä, 39(1). https://doi.org/10.23983/mv.61434 Rämö, A. & Liski, J. (19.2.2018). Saariston Sampo. Suomen Kuvalehti, kotimaa. Su, Y., Hu, J., & Lee, D. K. L. (2020). Delineating the transnational network agenda-setting model of mainstream newspapers and twitter: A machine-learning approach. Journalism Studies. https://doi.org/10.1080/1461670X.2020.1812421 23 Markus Mykkänen, tutkijatohtori, Kielija viestintätieteiden laitos, Jyväskylän yliopisto, ORCID ID: 0000–0002–7044–9263 Aleksi Koski, projektitutkija, Kielija viestintätieteiden laitos, Jyväskylän yliopisto, ORCID ID: 0000-0003-0351-4982