Një projekt i brendshëm sekret i kompanisë Anthropic, i quajtur “Project Panama”, zbulon se kompania bleu dhe shkatërroi miliona libra fizikë për t’i kthyer në të dhëna trajnimi për modelet e saj të Inteligjencës Artificiale. Dokumentet u bënë publike gjatë një procesi gjyqësor për shkelje të të drejtave të autorit.
Makineri hidraulike që presin shtyllën kurrizore të librave, skanerë industrialë që përpunojnë mijëra faqe në orë dhe kamionë që transportojnë letrën për riciklim. Kjo ishte mënyra se si Anthropic ndërtoi një bazë private të dhënash për trajnim, sipas dokumenteve të brendshme të publikuara në një proces gjyqësor federal në SHBA.
Në një nga dokumentet, kompania e përshkruan “Project Panama” si një përpjekje për të “skanuar në mënyrë shkatërruese të gjithë librat në botë”, ndërsa një shënim tjetër shton: “Nuk duam që të bëhet e ditur se po punojmë për këtë.”
Lexo edhe: Kompanitë e AI-së po blejnë libra të vjetër për të trajnuar modelet e tyre, dhe më pas i shkatërrojnë
Si funksiononte “Project Panama”
Sipas dokumenteve të paraqitura në gjykatë, Anthropic shpenzoi dhjetëra milionë dollarë për të blerë libra të përdorur në sasi të mëdha nga kompani si Better World Books dhe World of Books.
Procesi ishte i standardizuar:
-shtylla kurrizore e librit hiqej me makineri hidraulike;
-faqet kalonin në skanerë industrialë me shpejtësi të lartë;
-letra dërgohej për riciklim;
-versioni digjital ruhej në një arkiv privat për trajnim të modeleve të inteligjencës artificiale.
Sipas dokumenteve, infrastruktura ishte projektuar për të përpunuar deri në 2 milionë libra në vetëm gjashtë muaj, ose rreth 11 mijë libra në ditë. Anthropic vlerësonte se mund të siguronte rreth 40 milionë tituj, nga një total prej rreth 130 milionë librash unikë të botuar në botë.
Korpusi i krijuar nuk është i aksesueshëm për publikun, bibliotekat apo autorët dhe përdoret vetëm për trajtimin e modeleve të kompanisë.
Vendimi i gjykatës: libra të blerë, jo libra të piratuar
Çështja u bë pjesë e një procesi gjyqësor për të drejtat e autorit, ku gjykata bëri një dallim të rëndësishëm mes librave të piratuar dhe atyre të blerë ligjërisht.
Sipas dokumenteve, përpara nisjes së “Project Panama”, Anthropic kishte trajnuar modelet e saj edhe me miliona libra elektronikë të marrë nga biblioteka pirate në internet, pa leje dhe pa kompensuar autorët. Kjo praktikë ishte pjesë e padisë që çoi në një marrëveshje prej 1.5 miliardë dollarësh, një nga më të mëdhatë të lidhura me të dhënat e trajnimit të Inteligjencës Artificiale.
Gjykatësi federal William Alsup vendosi se përdorimi i librave të blerë ligjërisht dhe të skanuar për trajnim mund të konsiderohet “fair use” (përdorim i drejtë), pasi përmbajtja përdoret për një qëllim transformues dhe jo si zëvendësim i veprës origjinale. Në thelb, gjykata bëri dallimin mes mbajtjes së kopjeve pirate dhe skanimit të një libri të blerë, edhe nëse ai shkatërrohet gjatë procesit.
Debati për trashëgiminë kulturore
Rasti ka nxitur debat për mënyrën se si kompanitë e Inteligjencës Artificiale po sigurojnë materialet për trajnim. Ndryshe nga projekti Google Books, i cili krijoi një indeks të kërkueshëm për publikun dhe bibliotekat, arkiva e krijuar nga Anthropic mbetet plotësisht private dhe nuk ofron asnjë përfitim publik.
Kritikët argumentojnë se një libër fizik, nëse ruhet siç duhet, mund të mbijetojë për shekuj, ndërsa modelet e inteligjencës artificiale përditësohen ose zëvendësohen brenda pak vitesh. Ata paralajmërojnë se, nëse praktika e blerjes, skanimit dhe shkatërrimit të librave konsiderohet rruga më e sigurt ligjore për trajnim, kërkesa për libra të përdorur mund të rritet ndjeshëm, duke ndikuar edhe në tregun e librarive dhe bibliotekave.




