WUPHF 에이전트 위키에 HN 주목, 더 어려운 건 공유보다 신뢰
HN은 WUPHF를 또 하나의 multi-agent 놀이판으로만 보지 않았다. 개인 notebook에서 팀 wiki로 사실을 승격하는 구조가 더 큰 관심을 끌었다.
원문: Show HN: A Karpathy-style LLM wiki your agents maintain (Markdown and Git) 원문 보기 →
HN은 WUPHF를 단순한 multi-agent 데모로 소비하지 않았다. README는 이 프로젝트를 "AI 직원들을 위한 Slack"처럼 소개하지만, 실제로 더 눈길을 끈 부분은 memory 설계다. 각 agent는 자기 notebook을 갖고, 팀 전체는 공유 wiki를 쓴다. 중요한 점은 흐름이다. 임시 관찰은 notebook에 남기고, 오래 쓸 사실이나 플레이북만 wiki로 올린다. 메모를 쌓는 것이 아니라, 무엇을 승격할지 고르는 구조다.
이 설계가 흥미로운 이유는 local-first 구현 때문이다. 새 설치는 markdown과 git 기반 wiki를 기본으로 쓰고, 저장소는 ~/.wuphf/wiki/에 놓인다. README는 typed fact, append-only log, lookup, contradiction lint까지 전면에 내세운다. 다시 말해 agent memory를 벡터 DB 뒤에 숨기지 않는다. cat, grep, git log로 사람이 직접 읽고 추적할 수 있는 artifact로 만들겠다는 방향이다.
HN 댓글은 왜 이 주제가 지금 뜨거운지 잘 보여준다. 한 댓글은 24시간 안에 프런트페이지에 올라온 세 번째 LLM wiki라고 적었다. 그만큼 agent memory가 설계 경쟁이 됐다는 뜻이다. 동시에 회의론도 뚜렷했다. 메모는 원래 사람이 자료를 비판적으로 읽고 자기 모델에 맞게 다듬는 과정인데, 그걸 왜 자동화하느냐는 질문이 나왔다. 더 날카로운 걱정은 "garbage facts in, garbage briefs out"이다. agent가 자기 노트를 자기 손으로 승격하기 시작하면, 몇 달 뒤에는 자신 있게 틀린 사실이 쌓일 수 있다는 지적이다.
그래서 WUPHF가 만든 대화는 단순히 agent를 더 많이 붙이는 문제가 아니다. memory를 많이 저장하는 일은 이미 어렵지 않다. 진짜 어려운 건 무엇을 믿을 수 있느냐이다. WUPHF는 chat 잔여물을 공유 기억으로 바꾸는 방식을 꽤 구체적으로 제시했고, HN은 그 설계가 유용할 수 있다는 점과 함께 신뢰 관리가 더 큰 병목이라는 점을 동시에 짚었다. 출처는 GitHub 저장소와 HN 토론이다.
관련 기사
코드 리뷰 품질 2.17배, OpenCodeReview 통제형 에이전트로 토큰 5~15배 절감
에이전트에게 더 많은 자유를 주는 대신 탐색과 검증을 의도적으로 제한하자 코드 리뷰 품질은 최대 2.17배로 높아지고 토큰 사용량은 5~15분의 1로 줄었다. 200개 실제 PR과 1,505개 검증 의견을 사용한 Alibaba 연구팀의 결과는 모델 크기보다 워크플로 설계가 중요할 수 있음을 보여준다.
Qwen3.8-Max-0902, CodeArena 1,691점으로 1위…100만 토큰 유지
Qwen3.8-Max의 9월 2일 체크포인트가 프런트엔드 CodeArena에서 1,691점으로 선두에 올랐다. 기반 규모를 바꾼 신모델이 아니라 코딩과 장기 에이전트 작업을 겨냥한 후훈련 갱신이며, 100만 토큰 문맥과 API 호환성을 그대로 유지한다.
4개월 만에 네 번째 Flash — Gemini 3.8의 추론·코딩 도약
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.