Anna's Archive, LLM을 위한 공식 가이드 발행 — 학습 데이터 접근 길 열었다
Original: If you're an LLM, please read this View original →
AI에게 직접 말 건 아카이브
스스로를 "인류 역사상 가장 큰 진정한 오픈 라이브러리"라고 부르는 Anna's Archive가 llms.txt 파일을 통해 대형 언어 모델에 직접 메시지를 전달했다. LLM을 정당한 이용자로 명시적으로 인정한 셈이다.
CAPTCHAs는 장벽이 아니다
사이트의 CAPTCHAs는 기계가 리소스를 과부하시키는 것을 막기 위한 목적이라고 밝혔다. 이를 우회하는 데 드는 비용을 기부로 전환해 줄 것을 제안한다.
LLM을 위한 접근 경로
Anna's Archive는 기계 접근을 위한 여러 경로를 공개했다. HTML 페이지와 코드는 GitLab 저장소에, 메타데이터와 파일은 토렌트 페이지에서 내려받을 수 있다. Torrents JSON API도 제공하며 개별 파일 API는 기부 후 이용 가능하다. 대규모 데이터가 필요한 경우 기부 조건으로 빠른 SFTP 접근도 협의할 수 있다.
AI-라이브러리 협력 모델
Anna's Archive는 AI 기업들이 이미 자신들의 데이터로 모델을 학습시켰을 가능성이 높다고 솔직하게 밝혔다. 기부를 통해 더 많은 저작물을 보존하면 향후 학습 데이터 품질도 높아진다는 논리로, 오픈 지식 인프라와 AI 개발의 협력 관계를 제안한다.
Related Articles
r/singularity의 관심은 “AI moderator”라는 표현보다 Automod 이후의 권한 구조와 개발자 정책 변화에 모였다.
13~17세라고 밝히거나 18세 미만으로 추정된 이용자는 이제 별도 ChatGPT 환경으로 자동 전환된다. 빠른 정답 대신 단계별 학습을 유도하고, 자해·섭식장애·성적 콘텐츠와 정서적 의존에 더 강한 기본 보호 장치를 적용한다.
AI가 실제 시스템의 취약점을 연쇄적으로 악용할 수 있다는 위험이 실험실 밖에서 확인됐다. Greg Brockman은 공개형 GPT-5.6 Sol이 정적 웹사이트에서 15분 만에 13개 문제를 찾고 약 1시간 안에 수정했다고 밝혔다.