Laatuportti: näin toinen kielimalli arvioi tekoälyn kirjoittaman tekstin
Vastaus lyhyestiLaatuportti on erillinen mallikutsu, joka pisteyttää kirjoittajamallin tekstin julkisella rubriikilla: faktat ja lähteet 40, hyöty 25, omaperäisyys 15, kieli 10, rakenne 10. Alle 70 pistettä johtaa yhteen korjauskierrokseen, ja toinen alitus tallentaa artikkelin hylättynä. Tutkimuksen mukaan vahva malli on tuomarina yli 80 prosentissa tapauksista samaa mieltä ihmisten kanssa, mutta sillä on tunnettuja vinoumia. Siksi portti karsii, ihminen päättää.
Tämän sivuston jokaisen artikkelin lopussa lukee pistemäärä. Se on laatuportin antama luku nollasta sataan, ja sen antoi toinen kielimalli, ei ihminen. Tässä on rubriikki kokonaisuudessaan, syyt painotuksille, ja se, mitä tutkimus sanoo kielimallin luotettavuudesta tuomarina.
Rubriikki on julkinen, koska muuten pistemäärä ei kerro mitään
Portti pisteyttää viisi asiaa. Faktat ja lähteet painavat 40 pistettä: jokainen luku ja väite pitää olla jäljitettävissä tekstissä mainittuun lähteeseen, ja yksikin keksitty luku pudottaa tämän osan nollaan ja hylkää artikkelin. Hyöty painaa 25 pistettä: vastaako teksti otsikon kysymykseen ensimmäisessä sadassa sanassa, ja oppiiko lukija jotain, mitä ei saa kymmeneltä muulta sivulta. Omaperäisyys painaa 15 pistettä: oma koe, oma data, oma putki tai suomenkielinen näkökulma, jota muualla ei ole. Kieli painaa 10 pistettä: luonteva suomi ilman käännöskieltä, jargonia ja täytelauseita. Rakenne painaa 10 pistettä: tiivistelmä toimii yksin, väliotsikot ovat väitteitä, numeroituja listoja ei ole ilman syytä, ja pituus on asian mukainen.
Kynnys on 70. Alle kynnyksen jäävä teksti palautetaan kirjoittajamallille portin palautteen kanssa, ja se saa yhden korjauskierroksen. Jos toinen versio jää edelleen alle 70, artikkeli tallennetaan hylättynä ja näytetään taululla syineen. Hylkäys ei ole virhe, joka piilotetaan, vaan sivuston sisältöä.
Portin palaute ei ole pelkkä luku. Se kirjoittaa jokaisesta osasta yhdestä kolmeen huomiota: mikä luku on ilman lähdettä, missä tiivistelmä ei vastaa otsikkoon, mikä väliotsikko on aiheen nimi eikä väite. Korjauskierroksella kirjoittajamalli saa nämä huomiot sellaisenaan, ja julkaistussa artikkelissa huomiot näkyvät lukijalle kone-lohkossa. Lukija näkee siis saman palautteen kuin kirjoittaja.
Painotus ei ole sattumaa. Faktat saavat 40 pistettä, koska keksitty luku on ainoa asia, joka tuhoaa tekstin arvon kokonaan. Se on myös se, mitä Google pyytää tekoälysisällön ohjeessaan ensimmäisenä: tarkkuus, laatu ja relevanssi, myös metatiedoissa. Hyöty ja omaperäisyys yhdessä painavat toiset 40, koska ne ovat Googlen laatuarvioijien käsikirjan Lowest-luokan vastakohta. Rater Guidelines (versio 11.9.2025) kuvaa alimman laadun sivun pääsisältöä sanoin “little to no effort, has little to no originality and the MC adds no value compared to similar pages on the web”. Kieli ja rakenne saavat vähiten, koska ne ovat helpoin korjata ja huonoin syy hylätä muuten hyvä teksti.
Tutkimus sanoo, että mallituomari osuu usein mutta on vinoutunut
Ajatus mallista tuomarina ei ole tämän sivuston keksintö. Zheng ym. julkaisivat vuonna 2023 tutkimuksen Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, jossa GPT-4:ää käytettiin arvioimaan keskusteluavustajien vastauksia. Tulos oli, että vahva malli tuomarina on yli 80 prosentissa tapauksista samaa mieltä ihmisarvioijien kanssa, sekä kontrolloiduissa että joukkoistetuissa vertailuissa. Se on kirjoittajien mukaan samaa tasoa kuin ihmisten keskinäinen yksimielisyys.
Sama tutkimus nimeää neljä ongelmaa. Sijaintivinouma: malli suosii vertailussa ensimmäisenä esitettyä vastausta. Pituusvinouma: malli suosii pidempää vastausta, vaikka se ei olisi parempi. Itsesuosintavinouma: malli suosii tekstiä, jonka se on itse tuottanut. Ja rajallinen päättelykyky: tuomari tekee virheitä tehtävissä, jotka vaativat laskemista tai monivaiheista päättelyä.
On syytä sanoa, mitä 80 prosenttia tarkoittaa ja mitä ei. MT-Bench mittasi, kumpi kahdesta vastauksesta on parempi. Se ei mitannut, huomaako tuomari keksityn luvun. Faktantarkistus on eri tehtävä kuin laatuvertailu, ja tässä sivustolla sen paino on suurin. Siksi rubriikin faktaosa ei pyydä porttia arvioimaan, onko luku oikein, vaan onko lukua vastaava lähde tekstissä ja sanooko lähde saman. Se on tarkistettava kysymys, ei mielipide.
Gu ym. kokosivat vuonna 2024 katsauksen A Survey on LLM-as-a-Judge. Sen tiivistelmä sanoo suoraan, että mallituomarin luotettavuuden varmistaminen on edelleen merkittävä haaste, joka vaatii huolellista suunnittelua ja standardointia, ja käsittelee keinoja parantaa johdonmukaisuutta ja vähentää vinoumia. Katsaus ei anna yhtä lukua, jolla portin osuvuuden voisi luvata, eikä tämä sivusto lupaa sellaista.
Näin rubriikki yrittää kiertää tunnetut vinoumat
Sijaintivinouma ei koske porttia, koska portti ei vertaa kahta tekstiä vaan pisteyttää yhden rubriikkia vasten. Pituusvinouma on todellinen riski, ja siksi rakenneosassa on kohta “pituus asiaan nähden” ja kirjoitusohje sanoo, että 700 sanan asia on 700 sanaa. Portti saa ohjeen pudottaa pisteitä täytteestä, ei antaa niitä pituudesta.
Itsesuosintavinouma on vaikein, koska kirjoittaja ja tuomari ovat samaa mallisukua. Sivuston ratkaisu on kaksiosainen. Portti on erillinen kutsu omalla järjestelmäohjeellaan, eikä se näe kirjoittajan keskustelua, vain valmiin tekstin ja lähdelistan. Ja rubriikin painavin osa on rakennettu niin, ettei siihen tarvita makua: onko lähde, onko luku lähteessä. Kirjoittajamallin web search -työkalu palauttaa Claude-alustan dokumentaation mukaan jokaiseen sitaattiin URL:n, otsikon ja enintään 150 merkin lainauksen lähteestä. Portti voi verrata tekstin väitettä tuohon lainaukseen. Se ei ole täydellinen tarkistus, mutta se on jotain muuta kuin mallin mielipide.
Rajallinen päättelykyky jää. Portti ei huomaa, jos artikkeli laskee kustannusarvion väärin oikeista luvuista, ellei se laske itse perässä. Se ei huomaa, jos lähde on oikea mutta vanhentunut. Se ei huomaa, jos koko aihe on turha. Nämä ovat ihmisen tehtäviä.
Portti ei korvaa ihmistä, se säästää ihmisen aikaa
Portin tehtävä on karsia. Se pysäyttää tekstin, jossa on lähteetön luku, tiivistelmä, joka ei vastaa otsikkoon, tai väliotsikot, jotka ovat aiheen nimiä eivätkä väitteitä. Näihin ihmisen ei tarvitse käyttää aamuaan. Ihmisen tehtäväksi jää se, mihin portti ei pysty: onko teksti totta, onko se tarpeellinen, ja uskaltaako sen alle laittaa oman nimensä.
Tällä sivustolla ihminen on Ilkka Immonen, ja hänen tarkistuksensa tila lukee jokaisessa artikkelissa portin pisteiden alla. Kaksi arviota, kone ja ihminen, rinnakkain. Jos ne ovat usein eri mieltä, se on kiinnostavin tulos, mitä tämä koe voi tuottaa, ja se kerrotaan taululla. Vastuun jakoa tarkemmin käsittelee artikkeli Tekoälyteksti ja E-E-A-T: kuka on vastuussa, kun kone kirjoittaa?, ja koko putki on kuvattu pilarissa Automaattinen sisällöntuotanto.
Rehellisyyden vuoksi: launch-erä, johon tämä teksti kuuluu, on kirjoitettu 22.9.2026 Claude-agenteilla, ja tämän tekstin pistemäärä on kirjoittajan oma arvio samalla rubriikilla, ei erillisen porttikutsun antama. Automaattinen portti alkaa toimia ensimmäisen ajastetun ajon myötä, ja sen jälkeen pistemäärät ovat toisen mallin antamia. Ensimmäinen kiinnostava luku on se, kuinka moni artikkeli jää alle 70:n.
Kysymyksiä, joita tästä haetaan
Voiko sama malli arvioida oman tekstinsä?
Voi, mutta tutkimus on tunnistanut itsesuosintavinouman: malli suosii omaa tuotostaan. Tällä sivustolla portti on erillinen kutsu omalla ohjeellaan, ja rubriikki painottaa tarkistettavia asioita, joissa vinouma vaikuttaa vähiten.
Miksi kynnys on 70 eikä 90?
Kynnys on valittu niin, että portti hylkää ilmeiset puutteet mutta ei hyvää tekstiä, jolla on yksi pehmennetty väite. Luku ei perustu tutkimukseen vaan on lähtöarvo, jota säädetään, kun hylkäysdataa kertyy.
Lähteet
- Zheng ym.: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (arXiv 2306.05685)GPT-4 tuomarina yli 80 % yksimielisyys ihmisten kanssa; sijainti-, pituus- ja itsesuosintavinouma, rajallinen päättely
- Gu ym.: A Survey on LLM-as-a-Judge (arXiv 2411.15594)Katsaus: luotettavuus vaatii huolellista suunnittelua; johdonmukaisuus ja vinoumien vähentäminen
- Google Search Central: Guidance on using generative AI contentTarkkuus, laatu ja relevanssi ensimmäisenä vaatimuksena, myös metatiedoissa
- Google: Search Quality Rater Guidelines (PDF, 11.9.2025)Lowest-taulukko: vähän vaivaa, vähän omaperäisyyttä, ei lisäarvoa verrattuna vastaaviin sivuihin
- Claude Developer Platform: Web search toolSitaatit sisältävät url-, title- ja cited_text-kentät, joista portti voi tarkistaa lähteen olemassaolon
Löysitkö virheen?
Tämän tekstin kirjoitti kone ja toinen kone tarkisti faktat. Ihminen ei ole lukenut jokaista tekstiä. Jos jokin on väärin, kerro — ilmoitus menee Ilkka Immoselle, korjaus tehdään ja se merkitään tähän tekstiin näkyviin.