ஜெமினியைப் பயிற்றுவிப்பதற்காகப் பயன்படுத்தப்படும் புத்தகங்களின் மீது கூகுள் கிளாஸ் ஆக்ஷன்
மூன்று வெளியீட்டாளர்கள், நாவலாசிரியர் ஸ்காட் டுரோ மற்றும் அவரது நிறுவனமான SCRIBE ஆகியோர் ஜெமினிக்கு பயிற்சி அளிக்க மில்லியன் கணக்கான புத்தகங்கள் மற்றும் பத்திரிகை கட்டுரைகளை கூகுள் நகலெடுத்ததாக குற்றம் சாட்டி ஒரு முன்மொழியப்பட்ட வகுப்பு நடவடிக்கை வழக்கை தாக்கல் செய்துள்ளனர். இதில் Google Books, Play Books மற்றும் Scholar மூலம் வழங்கப்படும் படைப்புகளும் அடங்கும்.
ஜூலை 10 அன்று, ஹாசெட் புக் குரூப், செங்கேஜ் லேர்னிங், எல்சேவியர், டுரோ மற்றும் ஸ்க்ரைப் ஆகியவை இணைந்து, நியூயார்க்கின் தெற்கு மாவட்டத்திற்கான அமெரிக்க மாவட்ட நீதிமன்றத்தில் தாக்கல் செய்யப்பட்ட ஒரு வழக்கை, அதே நாளில் அமெரிக்க வெளியீட்டாளர்கள் சங்கம் அறிவித்தது. இந்தச் சேவைகளுக்கு வழங்கப்பட்ட புத்தகங்கள் மற்றும் கட்டுரைகள் குறிப்பிட்ட நோக்கங்களுக்காகவே இருந்தன என்றும், வணிக ரீதியான AI மாதிரியைப் பயிற்றுவிப்பதற்கு அவற்றைப் பயன்படுத்துவது அவற்றில் ஒன்றல்ல என்றும் அவர்கள் வாதிடுகின்றனர். கடற்கொள்ளையர் தளங்கள் மற்றும் கட்டண நூலகங்கள் உட்பட வலை ஸ்கிராப்புகளிலிருந்து பெறப்பட்ட படைப்புகளை கூகிள் நகலெடுத்ததாகவும் வழக்கு கூறுகிறது. புகாரை வெளியிடும் வரை கூகுள் கருத்து தெரிவிக்கவில்லை, மேலும் எந்த உரிமைகோரல்கள் மீதும் எந்த நீதிமன்றமும் தீர்ப்பளிக்கவில்லை. ஒரு பயன்பாட்டிற்கான அனுமதியானது அந்தத் தரவில் ஒரு மாதிரியைப் பயிற்றுவிப்பதை உள்ளடக்கியதா என்பது முக்கிய கேள்வி.
புகார் என்ன கூறுகிறது
புகார் நான்கு குற்றச்சாட்டுகளைக் கொண்டுவருகிறது. கூகுள் புக்ஸ் மற்றும் பிற கூகுள் சேவைகளை உள்ளடக்கிய பதிப்புரிமைச் சட்டத்தின் கீழ் அங்கீகரிக்கப்படாத மறுஉருவாக்கம், வலை ஸ்கிராப்பிங் பதிவிறக்கங்கள் மற்றும் பயிற்சியின் போது நகலெடுத்தல் என மூவர் குற்றம் சாட்டுகின்றனர். நான்காவது கூகுள் DMCA ஐ மீறி பதிப்புரிமை மேலாண்மை தகவலை நீக்கியதாக குற்றம் சாட்டுகிறது. வாதிகள் நஷ்டஈடு, தடை உத்தரவு, பயிற்சிக்கு பயன்படுத்திய ஜெமினி படைப்புகள் பற்றிய விரிவான கணக்கு மற்றும் அங்கீகரிக்கப்படாத நகல்களை நீக்க நீதிமன்ற உத்தரவு ஆகியவற்றைக் கேட்கிறார்கள். AIக்கான Google Play புத்தகங்களிலிருந்து புத்தகங்களைப் பயன்படுத்துவது “Google க்கு மிகவும் சிக்கலானது” என, “$10Bs-$100Bs” வரை அபராதம் விதிக்கப்படும் என அழைக்கப்படுகிறது. இது ஜெமினியின் முன்னணி பொறியாளருக்கு மற்றொரு வரியைக் கூறுகிறது, அவர் சக ஊழியர்களிடம், “எங்களிடம் ஏற்கனவே உள்ள அல்லது ஏற்கனவே வைத்திருக்கும் தரவுகளுக்கு நாங்கள் ஒப்பந்தங்களைச் செய்வதில்லை” என்று கூறுகிறது. இந்த ஆவணங்கள் எதுவும் பொதுவில் இல்லை, மேலும் மேற்கோள்கள் வாதிகள் தாக்கல் செய்வதிலிருந்து வந்தவை.
கிராலர் கட்டுப்பாடுகள் நிறுத்தப்படும் இடத்தில்
Google-Extended என்பது உங்கள் தளத்தில் இருந்து Google வலைவலம் செய்யும் உள்ளடக்கத்தை உள்ளடக்கிய robots.txt டோக்கன் ஆகும். எதிர்கால ஜெமினி பயிற்சி மற்றும் சில அடிப்படைப் பயன்பாடுகளுக்கு அந்த உள்ளடக்கத்தைப் பயன்படுத்த முடியுமா என்பதை இது கட்டுப்படுத்துகிறது. இங்கே விவாதிக்கப்பட்ட இரண்டு ஆதார முறைகளில் எதுவும் அந்த டோக்கனை உள்ளடக்கவில்லை. ஒப்பந்தங்கள் மூலம் புத்தகங்கள் Googleளுக்கு நேரடியாக வழங்கப்பட்டன, எனவே robots.txt கோப்பு இந்தச் செயல்முறையைப் பாதிக்காது. இணைய ஸ்கிராப்பிங் உரிமைகோரல்கள், புகாரின் படி, பைரேட் தளங்கள் மற்றும் சந்தா நூலகங்களில் ஹோஸ்ட் செய்யப்பட்ட பிறகு காமன் க்ராலில் தோன்றிய நகல்களைக் குறிக்கிறது. இந்த நகல்கள் வெவ்வேறு டொமைன்களில் ஹோஸ்ட் செய்யப்படுவதால், robots.txt கோப்பால் அவற்றைக் கட்டுப்படுத்த முடியாது.
ஜூன் 25 அன்று, கூகுள் ஒரு கொள்கை அறிக்கையை வெளியிட்டது, இது பொது இணையத் தரவுகளின் மீதான பயிற்சியானது நியாயமான பயன்பாட்டுப் பாதுகாப்பின் கீழ் “மாற்றும், வெளிப்படுத்தாத பயன்பாடு” என்று வாதிடுகிறது. Google-Extended போன்ற இயந்திரம் படிக்கக்கூடிய கட்டுப்பாடுகளையும் கட்டுரை குறிப்பிடுகிறது, எந்த வலைத்தளங்கள் விலகுவதற்கு பயன்படுத்தலாம். இருப்பினும், இங்கு ஆய்வு செய்யப்பட்ட பொருள் வெவ்வேறு வழிகளில் வந்ததாகக் கூறப்படுகிறது.
கடந்த மாதம், டிஜிட்டல் கன்டென்ட் நெக்ஸ்ட், காமன் க்ரால் ஃபவுண்டேஷனுக்கு ஒரு இடைநிறுத்தம் மற்றும் விலகல் கடிதத்தை அனுப்பியது, பதிப்புரிமைச் சட்டம் ஒரு விலகல் அமைப்பாக செயல்படாது என்று வலியுறுத்தியது.
ஏன் திஸ் மேட்டர்ஸ்
அனுமதி கேள்வி மற்றும் நியாயமான பயன்பாட்டு கேள்வி ஆகியவை தனித்தனியான கவலைகள். எந்தவொரு ஒப்பந்தமும் பயன்பாட்டிற்கு அங்கீகாரம் அளிக்கவில்லை என்றாலும், புகார் இரண்டையும் தீர்க்கவில்லை என்றாலும் நியாயமான பயன்பாடு பொருந்தும்.
உங்கள் crawler அமைப்புகள் இந்தச் சூழ்நிலையைக் காட்டிலும் சிறிய காரணியாகும். ஜனவரியில், BuzzStream தரவு, 79% சிறந்த செய்தித் தளங்கள் குறைந்தபட்சம் ஒரு AI பயிற்சி போட்டையாவது தடுக்கின்றன, அதாவது Google-விரிவாக்கப்பட்ட முகவரிகள். இங்கே பகுப்பாய்வு செய்யப்பட்ட நகல்களின் இரண்டு குழுக்களும் அந்த அமைப்புகளைப் பாதிக்காத வழிகளில் வந்ததாகக் கூறப்படுகிறது.
முன்னால் பார்க்கிறேன்
2025 ஆம் ஆண்டில், இரண்டு வடக்கு கலிபோர்னியா தீர்ப்புகள் அவர்களுக்கு முன் பதிவுகளில் நியாயமான முறையில் பயிற்சிப் பயன்பாடுகளைக் கண்டறிந்தன. மானுடவியல் நீதிமன்றம் திருட்டு மத்திய-நூலக நகல்களின் சுருக்கத் தீர்ப்பை மறுத்தது, அதே நேரத்தில் மெட்டா நீதிபதி தனது முடிவு அந்த வாதிகளுக்கும் அவர்களின் பதிவுக்கும் குறிப்பிட்டது என்று வலியுறுத்தினார். கலிபோர்னியாவில் நடந்து வரும் In re Google Generative AI பதிப்புரிமை வழக்குகளில் தலையிடத் திட்டமிட்ட பின்னர், நியூயார்க்கில் தாக்கல் செய்ததாக வெளியீட்டாளர்கள் தெரிவித்தனர், மேலும் புதிய வழக்கு முன்மொழியப்பட்ட வகுப்பிற்கு வெளியே விழும் என்று அவர்கள் நம்பும் உரிமைகோரல்களைப் பாதுகாக்கிறது. அடுத்த படியாக கூகுளின் பதில், பதில் அல்லது பணிநீக்கம் ஆகும்.
