viihde /
Clauden uusi vesileima ei ole piilomerkki – näin se tunnistaa tekoälyn sanavalinnoista
Anthropic kertoo tulevien Claude-mallien jättävän tuottamaansa tekstiin tilastollisen vesileiman. Se ei perustu piilomerkkeihin eikä kerro käyttäjän henkilöllisyyttä, mutta voi auttaa arvioimaan, onko Claude osallistunut pitkän tekstin kirjoittamiseen.
Anthropic on kertonut tarkemmin, miten Clauden tuleva tekstivesileima toimii. TechCrunchin mukaan yhtiö vastasi samalla käyttäjiä askarruttaneisiin kysymyksiin muun muassa tekstin muokkaamisesta, oikoluvusta ja ohjelmakoodista.
Kyse ei ole tavallisesta, silmällä näkyvästä vesileimasta. Tekstiin ei lisätä erikoismerkkejä, näkymättömiä Unicode-merkkejä tai muuta ylimääräistä sisältöä.
Vesileima syntyy pienistä sanavalinnoista
Kielimalli muodostaa vastauksen valitsemalla seuraavan sanan tai merkkijonon useista mahdollisista vaihtoehdoista. Monissa kohdissa kaksi eri sanaa voi olla merkityksen kannalta yhtä käyttökelpoinen.
Vesileima hyödyntää juuri tällaisia vähämerkityksisiä valintoja. Tavallisen satunnaisuuden sijasta sanan valintaan vaikuttavat salainen avain ja sitä edeltävät sanat, jolloin pitkään tekstiin muodostuu tilastollisesti tunnistettava kuvio.
Anthropic käyttää Google DeepMindin vuonna 2024 esittelemään SynthID-Text-menetelmään pohjautuvaa ratkaisua. Yhtiön mukaan kuvio ei muuta tekstin merkitystä, luettavuutta tai luovuutta tavalla, jonka lukija huomaisi.
Tunnistus ei silti anna ehdotonta kyllä- tai ei-vastausta. Sen avulla voidaan arvioida todennäköisyyttä sille, että Claude on osallistunut tekstin tuottamiseen.
Lyhyt ja hyvin faktapitoinen teksti on vaikeampi tunnistaa
Menetelmä tarvitsee riittävästi sanavalintoja. Lyhyessä tekstissä havaintoja voi olla liian vähän, joten tunnistuksen varmuus kasvaa yleensä tekstin pituuden mukana.
Vesileimaa syntyy myös vähemmän kohtiin, joissa vain yksi ilmaus on asiasisällön kannalta oikea. Täsmällinen faktateksti tarjoaa mallille vähemmän turvallisia vaihtoehtoja kuin vapaamuotoinen kirjoitus.
Sama rajoitus koskee oikolukua. Jos ihminen on kirjoittanut lähes kaikki sanat ja Claude korjaa vain välimerkit tai muutaman kielioppivirheen, vesileimalle ei välttämättä jää tarpeeksi tilaa.
Jos Claude puolestaan muokkaa tekstiä perusteellisesti tai kirjoittaa siitä suurimman osan uudelleen, tunnistettavia valintoja kertyy enemmän.
Ohjelmakoodissa jälki jää tavallista heikommaksi
Toimivan ohjelmakoodin täytyy monissa kohdissa olla täsmällistä. Malli ei voi vaihtaa komentoa tai muuttujan rakennetta mielivaltaisesti vain vesileiman vuoksi, jos muutos rikkoisi ohjelman.
Vesileimaa voidaan silti syntyä esimerkiksi kommentteihin tai muihin kohtiin, joissa useampi ilmaisu toimii yhtä hyvin. Anthropicin mukaan vaikutuksen varsinaiseen koodiin pitäisi jäädä vähäiseksi.
Käännöksiin vesileima sen sijaan soveltuu, koska Claude valitsee silloin käytännössä kaikki kohdekielisen tekstin sanat.
Muokkaaminen voi heikentää tunnistusta
Kevyt jälkikäsittely ei Anthropicin arvion mukaan todennäköisesti poista kuviota kokonaan. Jokaisen sanan korvaava perusteellinen uudelleenkirjoitus voi kuitenkin hävittää sen.
Tämä tekee vesileimasta tunnistusvälineen, ei aukotonta todistetta tekstin alkuperästä. Se ei myöskään pysty kertomaan, onko tekstin tehnyt jokin toinen tekoälypalvelu, jolla on eri avain tai kokonaan toinen merkintätapa.
Vesileima ei paljasta käyttäjää
Anthropicin mukaan tekstin kuvioon ei tallenneta tietoa käyttäjästä, organisaatiosta tai yksittäisestä keskustelusta. Se kertoo korkeintaan Clauden mahdollisesta osuudesta sisällön tuottamisessa.
Merkintä ei myöskään ratkaise tekijyyttä, omistajuutta tai juridista vastuuta. Se ei esimerkiksi yksin osoita, kirjoittiko Claude koko tekstin vai muokkasiko se ihmisen luonnosta voimakkaasti.
Yhtiö aikoo julkaista vesileimojen tarkistamiseen rajapinnan. TechCrunch huomauttaa, että menetelmä eroaa tavallisista tekoälytekstin tunnistimista, jotka etsivät kirjoitustyylistä mallien suosimia ilmauksia ilman pääsyä vesileima-avaimeen.
Käyttöönotto alkaa maailmanlaajuisena
Anthropic perustelee muutosta EU:n tekoälysääntelyllä ja tekoälysisällön läpinäkyvyyttä koskevalla käytännesäännöstöllä. Yhtiö aikoo ottaa merkinnän aluksi käyttöön maailmanlaajuisesti, koska sillä ei vielä ole kestävää tapaa rajata toimintoa alueittain.
Kuva-, SVG- ja muihin tuettuihin tiedostoihin Claude liittää tekstivesileiman sijasta C2PA-standardin mukaisen sisältötunnisteen tiedoston metatietoihin. Vanhempiin Claude-malleihin tekstimerkintää on tarkoitus tuoda siirtymäajan kuluessa.
Uusi selitys tarkentaa merkittävästi aiempaa ilmoitusta vesileimauksesta: tavallinen lukija ei näe merkintää, mutta menetelmän haltija voi etsiä pitkän tekstin sanavalinnoista Claudelle ominaista tilastollista jälkeä.