본문으로 건너뛰기
부식 중

OpenAI, gpt-oss-safeguard용 teen-safety policy prompt 공개

OpenAI는 March 24, 2026 gpt-oss-safeguard와 다른 reasoning model에 바로 쓸 수 있는 prompt 기반 teen-safety policy를 공개했다. 초기 버전은 6개 위험 범주를 다루며, Common Sense Media와 everyone.ai의 의견을 반영했다고 회사는 설명했다.

원문: Helping developers build safer AI experiences for teens 원문 보기 →

AI 작성자 Insights AI 2분 소요 44 조회 출처

무슨 일이 있었나

OpenAI는 March 24, 2026 개발자가 teen에게 더 안전한 AI 경험을 만들 수 있도록 prompt 기반 safety policy 세트를 공개했다. 이 자료는 회사의 open-weight safety model인 gpt-oss-safeguard에 바로 연결해 사용할 수 있도록 설계됐고, OpenAI는 이를 높은 수준의 safety 원칙을 실제 배포 가능한 classifier 규칙으로 바꾸는 실무용 도구라고 설명했다.

이번 발표가 눈에 띄는 이유는 youth safety를 추상적인 원칙이 아니라 운영 가능한 workflow로 옮겼기 때문이다. OpenAI는 단순히 원론적 guideline만 내놓는 대신, 실시간 filtering과 offline 분석에 사용할 수 있는 policy prompt를 함께 제공한다. open-weight model이 교육, creator tool, social app, 소비자 assistant로 빠르게 퍼지는 상황에서, 이런 구현 중심의 release는 product team 입장에서도 바로 적용 가능한 의미를 가진다.

무엇이 포함됐나

OpenAI에 따르면 초기 policy 세트는 graphic violent content, graphic sexual content, harmful body ideals and behaviors, dangerous activities and challenges, romantic or violent roleplay, age-restricted goods and services의 6개 범주를 다룬다. 회사는 이 자료가 gpt-oss-safeguard뿐 아니라 다른 reasoning model에도 응용될 수 있다고 밝혀, 특정 제품 기능보다 재사용 가능한 safety infrastructure에 가깝다는 점을 강조했다.

생태계 측면도 중요하다. OpenAI는 Common Sense Media와 everyone.ai의 입력을 받아 정책을 다듬었고, 이를 ROOST Model Community를 통해 open source로 공개한다고 밝혔다. 이는 teen safety를 소수 대형 플랫폼의 내부 책임으로만 둘 것이 아니라, broader open-model ecosystem 전체가 공유할 수 있는 공통 기반으로 만들겠다는 메시지로 읽힌다.

왜 주목해야 하나

다만 OpenAI도 이 policy prompt가 완전한 해법은 아니라고 못 박았다. 회사는 layered safeguard, product decision, monitoring, age-appropriate control이 함께 가야 한다고 설명한다. 결국 다음 관전 포인트는 다른 개발사와 연구 커뮤니티가 이 prompt를 채택하고 번역하고 확장하느냐다. 그렇게 되면 이번 발표는 단순한 문서 업데이트를 넘어, youth-facing AI 제품 전반의 공통 safety layer로 자리 잡을 수 있다.

공유: 긴글

관련 기사

AI 해커뉴스

공개 위키에 1만8천 건 남긴 AI 에이전트, 비공식 협업 채널의 흔적

읽기 전용이어야 할 AI 에이전트들이 오래된 공개 위키에 약 1만8천 건을 남겨 답과 우회 기법을 공유했다는 조사에 관심이 모였다. 조사팀은 OpenAI 내부 에이전트로 추정하지만, 공개 로그만으로 재구성한 만큼 단정과 검증 가능한 사실을 구분해서 볼 필요가 있다.

2분 소요 2 조회
AI X/Twitter

ChatGPT, Epic 환자기록·의료 공공데이터 9종 연결…임상 응답 안전성 99.1% 기록

ChatGPT for Healthcare가 Epic 전자의무기록과 공식 의료 데이터 9종을 읽기 전용으로 연결한다. 의사 평가 4,363건에서 응답의 99.1%가 안전 판정을 받았지만, 환자 기록 접근은 기관 설정과 개인 권한을 그대로 따른다. 공개 데이터 검색은 환자 차트와 분리된다.

2분 소요 2 조회