데이터와 방법론
숫자가 뜻하는 바를 알 수 있도록.
이 사이트 차트의 출처, 정의, 한계입니다. 관측 데이터와 계획 추정치를 구분합니다.
01
출시 추적
스냅샷은 Hugging Face 조직 ID 42개와 저장소 6,977개를 조회했습니다. 좋아요 250개 이상의 text-generation, image-text-to-text, any-to-any 모델을 유지하고 지정된 양자화 및 파생 형식은 제외합니다.
제품군은 매개변수 크기, 정밀도, 체크포인트, 지정된 출시 접미사를 통합합니다. Flash, Pro, Coder, Vision 같은 제품 계층은 구분합니다. 가장 이른 저장소 생성일을 출시일 대용으로, 가장 높은 좋아요 수를 인기도 기준으로 사용합니다.
| 기준 | 지난 365일 |
|---|---|
| 250+ | 113 |
| 500+ | 76 |
| 1,000+ | 42 |
서로 포함되는 기준이므로 세 수치를 합산하면 안 됩니다. 좋아요는 인기도이지 역량이 아닙니다. 신규 출시는 좋아요가 쌓일 시간이 짧고, ModelScope 전용 출시는 조사하지 않으며 제품군 매칭은 휴리스틱입니다. 월별 차트는 스냅샷이 속한 미완료 월을 제외합니다.
1차 출처: Hugging Face API ↗02
평가 범위
모델 카드, 기술 보고서, 출시 글, 독립 평가 보고서를 검토합니다. 검토 항목에는 근거가 뒷받침하는 가장 높은 공개 단계가 부여됩니다. 최고 단계가 그 모델의 모든 평가를 설명하지는 않습니다.
- T3독립 평가
- 공개된 방법론이 있는 독립 위험 역량 평가. 종합적인 테스트나 안전한 모델을 의미하지 않습니다.
- T2개발사 평가
- 개발사 수행 위험 역량 평가. 개발사는 독립 평가자가 아닙니다.
- T1개발사 문서
- 모델 카드 또는 일반 안전 정보는 있지만 출처 검토에서 기준에 맞는 위험 역량 평가를 찾지 못한 경우.
- T0평가를 찾지 못함
- 출처 검토를 완료했지만 기준에 맞는 평가나 안전 정보를 찾지 못한 경우. 부재의 증명은 아닙니다.
- —검토 대기
- 검토 미완료. T0나 평가 부재로 집계하지 않습니다.
제품군은 42개인데 항목은 왜 40개인가요?
높은 인기도 제품군 42개 중 17개가 기록에 포함되고 4개는 범위 밖이며 21개는 검토 대기입니다. 분류 기록 19개는 특정 출시 18개와 Qwen3.6 제품군 1개이며 Gemma 4에는 여러 체크포인트 기록이 있습니다. MiniMax-M2는 MiniMax-M2.5의 검토를 상속하지 않도록 대기 상태로 수정했습니다.
“독립 평가”는 개발사 외부의 평가자가 방법과 관련 결과를 공개했다는 뜻입니다. “내부 2차 검토”는 분류 기록 19개 중 12개가 9월 1일 AI를 활용한 두 번째 출처 검토를 받았다는 뜻입니다. 어느 표기도 제3자의 데이터셋 감사를 의미하지 않습니다.
V2에서는 T3 기록 6개의 등급 근거 보고서와 분류 기록의 인용 URL 57개를 다시 확인하고 제품군 매칭, 날짜, 리디렉션 출처를 수정했습니다. 여전히 내부 검토이며 외부 감사자의 승인은 없습니다. 불완전한 부재 판단과 체크포인트 모호성은 표시합니다.
출처가 있는 항목 살펴보기 ↗기록 하나를 처음부터 끝까지
Qwen3.5-122B-A10B
출처 확인
논문 초록은 통제된 자율 복제 실험의 모델로 Qwen3.5-122B-A10B를 명시합니다.
초록 · arXiv v1 ↗분류 기준 적용
T3는 공개 방법과 관련 자율성 결과가 있는 독립 평가를 기록합니다. 이는 우리의 출처 분류이며 저자가 부여한 등급이나 감사 보증이 아닙니다.
기준 읽기 ↗기록 추적
같은 기록이 장부 행, 홈페이지 사각형, 다운로드 데이터에 사용됩니다. 이 연구 하나로 다른 영역의 평가 범위나 모델의 전반적 안전성을 판단할 수는 없습니다.
model-qwen3-5-122b-a10b
출처 위치 확인: 2026년 9월 8일. 데이터셋은 9월 1일 스냅샷과 기존 분류를 유지합니다. 이 설명은 외부 감사가 아닙니다.
03
비용 추정
현재 평가 총액은 20만 달러로 수행 인력, 컴퓨팅, 스토리지와 전송, 조사와 합의된 재평가, 배분 운영비와 예비비를 포함합니다. 2026년 9월 7일 정한 프로그램 가격이며 공급자 견적, 실측 평균, 외부 감사 비용 모델은 아닙니다.
자금 계획은 2026년 초기 모금 400만 달러와 2027년 프로그램 예산 1,200만 달러입니다. 목표이며 확보된 후원금은 아닙니다. 세부 배분, 평가 수행 역량, 현금 이월을 조정 중입니다. 이전 직접 워크로드 범위는 대체되었으며 총액 배분의 근거가 아닙니다. 다운로드 데이터의 미확정 금액은 0이 아닌 null입니다.
포함 범위 보기 ↗04
주요 용어
- 오픈 가중치
- 다운로드하고 실행할 수 있는 모델 매개변수. 접근 및 라이선스 조건은 다를 수 있으며, 제한 없는 오픈 소스와 동일하지 않습니다.
- 위험 역량 평가
- 생물학·사이버·자율 작업 등에서 모델이 심각한 피해를 실질적으로 가능하게 하는지 테스트합니다. 정의된 범위를 다루며 모든 용도를 다루지는 않습니다.
- 블랙박스 / 화이트박스
- 블랙박스 테스트는 보통 엔드포인트를 통해 입력과 출력을 사용합니다. 화이트박스 작업은 가중치나 활성화 같은 내부 정보에도 접근합니다.
- 캠페인
- 모델을 중심으로 범위를 정한 평가·재현·후속 작업 프로그램. 출시 제품군, 장부 항목, GPU 작업과는 다른 단위입니다.
05
다운로드와 인용
다운로드에는 공개 필드와 출처 링크만 포함하고 내부 분류 메모는 제외합니다. 수치를 재사용할 때 스냅샷 날짜와 방법론을 함께 표기해주세요.
Pacific Compute Ledger, 2026-09-01, snapshot 17df23f. https://pacificcompute.org/ledger.
데이터 스냅샷: 2026년 9월 1일수정을 제안하려면 모델, 수정할 내용, 1차 출처를 보내주세요: [email protected].