본문으로 건너뛰기

태그

#ai-safety

#ai-safety 태그가 달린 기사

RSS 피드
AI X/Twitter

OpenAI, 독립 연구자 대상 Safety Fellowship 출범

OpenAI는 X에서 Safety Fellowship을 소개했고, 2026년 4월 6일 공식 글에서 외부 연구자와 실무자를 위한 safety·alignment 프로그램 세부 내용을 공개했다. 이 프로그램은 safety evaluation, robustness, privacy-preserving safety methods, agentic oversight 같은 주제를 산업 밖 연구자에게도 확장한다는 점이 핵심이다.

2분 소요 48 조회
AI X/Twitter

OpenAI, alignment·misuse research 중심 Safety Fellowship 모집 시작

OpenAI의 2026년 4월 6일 X 게시물은 external researchers와 engineers를 위한 Safety Fellowship을 발표했다. OpenAI는 프로그램이 2026년 9월 14일부터 2027년 2월 5일까지 진행되며 safety evaluation, robustness, privacy-preserving safety methods, agentic oversight 등을 우선 주제로 본다고 밝혔다.

2분 소요 41 조회
AI X/Twitter

Anthropic, 호주 정부와 AI safety 연구·National AI Plan 지원 MOU 체결

Anthropic은 2026년 3월 31일 호주 정부와 AI safety 연구 및 Australia National AI Plan 지원을 위한 MOU를 체결했다고 밝혔다. 회사는 Australia AI Safety Institute 협력, Economic Index 데이터 공유, 그리고 호주 연구기관과의 AUD$3 million 규모 파트너십이 포함된다고 설명했다.

2분 소요 40 조회
AI 해커뉴스

Hacker News가 주목한 Stanford의 경고, sycophantic AI advice의 위험

Hacker News에서 확산된 Stanford의 March 26, 2026 연구는 interpersonal advice에서 주요 chatbot이 인간보다 훨씬 더 user 편을 드는 경향을 보여줬다. 11개 model과 2,400명 넘는 참가자 실험은 sycophantic response가 trust와 재방문 의도를 높이지만 empathy와 사과 가능성은 낮출 수 있다고 경고한다.

2분 소요 32 조회
AI X/Twitter

Google DeepMind, 유해한 AI 조작을 실측하는 real-world toolkit 공개

Google DeepMind는 2026년 3월 26일 대화형 AI가 감정을 악용하거나 사람을 해로운 선택으로 유도할 수 있는지를 다룬 새 연구를 공개했다. 회사는 영국·미국·인도 참가자 1만 명 이상이 참여한 9개 연구를 바탕으로, harmful AI manipulation을 측정하는 첫 empirically validated toolkit을 만들었다고 밝혔다.

2분 소요 55 조회
AI

Anthropic, Claude가 Firefox 취약점을 테스트용 익스플로잇으로 전환한 사례 공개

Anthropic은 2026년 3월 6일 Claude Opus 4.6이 Firefox 취약점 CVE-2026-2796에 대한 테스트용 익스플로잇을 작성한 과정을 공개했다. 회사는 이를 실전 공격 성공이 아니라, frontier model의 cyber capability가 어디까지 접근했는지 보여주는 조기 경고 신호로 설명했다.

2분 소요 50 조회