
Microsoft-Decision-1이 Foundry에서 라이브 상태입니다. 벤치마크 탭은 비어 있습니다.
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 55 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
이번 주 Microsoft 릴리스에서 가장 흥미로운 점은 Microsoft-Decision-1이 무엇을 할 수 있는지가 아니다. 그것은 Microsoft가 그 모델에 관해 공개하지 않기로 선택한 것이다. 이 모델은 라이브 상태다: Microsoft Foundry에서 정식 출시되었으며, 2026년 10월 8일, 이 글을 쓰기 이틀 전이었다. 이것은 의사 결정 점수 모델이다 — 상태와 고정된 답변 집합이 있는 질문을 주면, 답변별로 보정된 확률을 반환한다 — Microsoft가 오픈 웨이트 Qwen3.5-9B를 기반으로 후처리 학습했으며, 최대 32,768개 토큰에 대해 한 번의 패스를 실행하고 0개의 출력 토큰을 방출한다. 왜냐하면 전혀 아무것도 생성하지 않기 때문이다. 카탈로그 페이지에는 Benchmarks 탭이 있다. 그 안에는 방법론 단락이 있고 수치는 없다.
그 격차가 바로 이 이야기의 핵심이며, 또 하나의 “Microsoft가 모델을 출시했다”는 항목보다 더 유용한 이야기입니다. 스코어러에 관한 모든 진지한 질문은 캘리브레이션 질문입니다 — 반환된 0.8이 정말 0.8을 의미하는가 — 그리고 단 하나의 Brier 점수나 기대 캘리브레이션 오차 수치도 없이 등장한 출시는, 정작 중요한 단 하나의 숫자를 이를 도입하는 누구든 측정해야 하는 몫으로 남겨 둡니다. 다음은 Foundry 페이지가 실제로 문서화하는 내용, 눈에 띄게 빠뜨린 내용, 그리고 평가 팀이 이번 주에 그것에 대해 할 수 있는 일입니다.
정확히 무엇이 출시되었나요?
Microsoft-Decision-1은 호스팅된 API입니다. 계약은 한 번의 호출 입력, 하나의 분포 출력이며, 경로 어디에도 디코딩 루프가 없습니다. 요청은 판단할 자료와 제한된 답변 집합을 가진 질문을 담고, 응답은 각 옵션에 대한 확률을 담습니다. Microsoft는 지원되는 질문 형태를 예/아니요, 객관식, 평점, 분류, 루브릭 기반으로 나열하며, 모두 최대 32K 토큰의 단일 호출 내에서 처리됩니다. 텍스트 전용입니다 — 이미지, 오디오, 비디오 입력은 없고, 출력은 숫자뿐입니다.
제외 사항은 기능만큼이나 분명하게 명시되어 있으며, 무엇보다 먼저 읽어볼 가치가 있다. 텍스트 생성, 개방형 질문 응답, 대화, 번역 또는 요약을 위해 설계되지 않았고, 입력에 없는 지식을 요구하는 작업을 위한 것도 아니다. 이는 근거를 제시하지 않는다. 공개된 사용 사례는 모두 플랫폼 팀이 이미 레이블된 결정을 내려야 하는 상황이다. 생성된 답변을 루브릭에 따라 평가하기, 검색 관련성 판단하기, 대기열 분류하기, 제안된 에이전트 도구 호출을 게이팅하기, 고정된 벤더 정책이 아니라 애플리케이션이 정의한 임계값에 따라 콘텐츠를 심사하기, 그리고 높은 신뢰도의 결과는 자동 수락하고 나머지는 에스컬레이션하기.
배포 목록에서 두 가지 운영상의 세부 사항이 눈에 띕니다. 첫 번째는 Microsoft가 제공된 증거가 불충분할 때 "판단할 수 없음"과 같은 기권 옵션을 명시적으로 지원한다는 점입니다. 이것이 보정된 스코어러와 단지 자신감만 있는 스코어러의 차이이며, 바로 이것이 임계값 처리를 가능하게 하는 요인입니다. 두 번째는 배치 추론이 비활성화되어 있다는 점입니다. 생성 모델에서처럼 배치 채널을 통해 대규모 스코어링 실행 비용을 분산할 수 없으므로, 호출당 지연 시간은 오프라인 작업의 문제가 아니라 여러분 파이프라인의 지연 시간입니다.
배포는 Foundry 전용이며, "Direct from Azure" 포트폴리오에서 표준 SKU의 서버리스 또는 통합 엔드포인트 배포 형태로 제공됩니다 — 종량제 또는 예약 프로비저닝 처리량. 가중치는 배포되지 않습니다. Hugging Face 저장소도 없고, 파인튜닝도 없으며, 셀프 호스팅 옵션도 없습니다. 애플리케이션은 표준 Azure 인증을 통해 통합됩니다. 학습 공개 정보에는 데이터셋이 처음 사용된 시기가 2026년 9월 수집 시점이라고 보고되어 있으며, 이는 학습 데이터와 GA 날짜 사이의 가능한 가장 짧은 간격으로, 다른 곳에서 공개된 베이스 모델에 대한 포스트트레인에서는 일반적인 일입니다.
벤치마크 탭, 전문 그대로 인용
다음은 Microsoft가 모델의 성능에 관해 공개한 내용의 전부입니다. 평가에는 "학습에 사용되지 않은 공개 및 커뮤니티 의사결정 벤치마크와 홀드아웃 내부 테스트 세트"가 사용되었습니다. 지표는 정확도, 보정 오차, 안전 재현율, 거짓 양성률, 공정성 일관성이었습니다. 선택지 순서는 다양하게 변경되었습니다. 대응 통계 검정이 적용되었습니다. 주장은 정성적입니다: Microsoft-Decision-1은 "선도적인 의사결정 모델과 동등한 성능을 보이며, 동일한 방법론으로 평가된 다른 오픈 의사결정 모델보다 앞서 있습니다."

그것은 결과 없이 설명된 유능한 평가 설계입니다. 그 점을 지적하는 것은 비난이 아닙니다 — 표가 없는 방법론 문단은 구체적이고 검증 가능한 선택이며, 이는 이 작은 범주에 속한 나머지가 내린 선택과는 다른 선택입니다. 마이크로소프트가 암묵적으로 비교하고 있는 오픈 결정 모델들은 자신의 수치를 공개합니다: InternLM의 Intern-Decision 제품군은 모델 카드에 Brier 및 기대 캘리브레이션 오류(expected-calibration-error) 수치를 기재하고, TypeSafe의 Jev는 둘 다 공개하며, Liquid AI의 d1 라인은 가중치와 함께 정확도 표를 제공합니다. 마이크로소프트는 이 그룹에서 가장 큰 회사이며, 신뢰를 바탕으로 받아들여 달라고 요청하는 유일한 회사입니다.
회사는 모델이 어디에 강하고 약하다고 보는지 분명히 밝히는데, 이는 대표 점수보다 더 실행 가능하다. 가장 강한 점: 추론, 규칙 적용, 프롬프트 형식에 대한 견고성. 경쟁력 있는 점: 분류, 검색, 공정성, 도구 사용 및 대부분의 다국어 작업. 가장 약한 점: 특화된 도메인 지식. 스스로 보고한 한계도 같은 방식으로 솔직하다 — 점수는 표현과 선택지 순서에 따라 달라질 수 있고, 잘못 구성된 질문에도 여전히 점수가 반환되며, 보정은 익숙한 작업 유형에서 가장 강하고, 답변이 틀려 보일 때 감사할 설명은 없다.
언어 지원 범위에도 같은 형태의 단서가 붙는다. 25개 언어가 지원되는 것으로 나열되어 있으며, 일본어, 한국어, 아랍어, 베트남어, 태국어, 터키어, 힌디어, 벵골어, 스와힐리어, 히브리어, 페르시아어, 우크라이나어 등을 아우른다. 다만 지원 범위, 품질, 보정이 "언어별로 다를 수 있다"는 점과 비영어, 특히 저자원 언어가 성능이 떨어지는 영역이라는 점을 명시적으로 경고한다. Qwen3.5-9B base는 200개가 훨씬 넘는 언어를 지원한다. 사후 학습은 그중 약 4분의 1을 유지했고, 보정은 바로 그 4분의 1에서 이루어졌다.

페이지에도 가격이 없네요
카탈로그의 가격 필드에는 요율이 표시되지 않습니다. 대신 Microsoft 자체의 모델 가격 책정 페이지로 연결되므로, 결정당 비용은 모델 카드가 아니라 Azure나 청구서에서 읽어 내는 값입니다. 대규모로 결정당 비용을 모델링하는 사람에게 이는 실질적인 공백이며, 추정하는 대신 명확히 밝힐 가치가 있습니다. 아키텍처에서 실제로 도출되는 두 가지가 있으며, 이는 그 추정에 반영할 가치가 있습니다: 호출 비용의 0%는 출력 토큰입니다, 출력 토큰이 전혀 없기 때문이며, 옵션 세트는 입력의 일부이므로 설명형 옵션 62개가 있는 질문은 예/아니오 질문보다 호출당 비용이 더 많이 듭니다. 당신은 답변이 아니라 자신이 작성한 평가 기준에 비용을 지불하는 것입니다.
왜 이러한 형태의 릴리스가 흥미로운 것인가
의사결정 스코어러(decision scorer)는 원시적 기업들이 실제로 필요로 하는 것이 더 나은 작성자가 아니라 더 저렴하고 더 신뢰할 수 있는 판정자라는 베팅이다. 그 베팅은 확률이 신뢰할 만할 때만 성과를 낸다. 스코어러의 다운스트림은 모두 임계값이기 때문이다. 0.7은 사람에게 에스컬레이션하고, 0.95는 자동 승인하며, 그 선을 잘못 긋는 비용은 토큰이 아니라 잘못된 자동 결정으로 치러진다. 캘리브레이션 테이블 없이 스코어러를 출시하는 벤더는 각 고객에게 자신의 데이터로 그것을 다시 도출하라고 요구하는 셈이다.
Microsoft 자체 문서에서 바로 그 점을 권장하는데, 이는 비판을 누그러뜨리는 동시에 실용적인 결론을 더 선명하게 만든다. 사용 사례를 대표하는 데이터로 검증하라. 기본값이 아니라 오류의 비용을 기준으로 임계값을 설정하라. 항상 기권 옵션을 포함하라. 순서가 답변에 편향을 줄 수 있는 경우에는 선택지 순서를 무작위화하라. 중대한 사안에는 사람이 개입하도록 하라. 이는 모든 채점자에게 타당한 조언이다. 이 채점자에게는 그것이 유일하게 제공되는 조언이다.
약속하지 않고 이번 주에 해보는 것
가장 저렴한 평가는 이미 수작업으로 내리는 결정을 하나 골라서, 애플리케이션이 실제로 제공할 답변 집합으로 레이블링된 사례 200개를 모으고, 그것들을 Foundry 배포를 통해 실행해 보는 것이다. 출력에 대한 기대 캘리브레이션 오류를 계산하면, Microsoft-Decision-1에 대해 Microsoft가 공개한 그 어떤 것보다 더 많은 것을 알게 될 것이다. 왜냐하면 내부 홀드아웃 테스트 세트가 아니라 자신의 분포에서 그것을 측정하게 되기 때문이다. 그것은 오후 한나절이면 되는 작업이며, 벤치마크 문제 전체를 종결시켜 버린다.
OrcaRouter가 들어맞는 자리는 채점 루프의 나머지 절반이며, 그것도 생성을 담당하는 절반입니다. 우리는 Microsoft-Decision-1을 호스팅하지 않고 우리 카탈로그에도 없습니다. 텍스트 대신 확률을 반환하는 모델은 채팅 완성을 라우팅할 대상이 아니며, 여기 어느 것도 가용성 주장으로 읽혀서는 안 됩니다. 우리의 단일 OpenAI 호환 키 뒤에 있는 것은 글을 쓰는 200개 이상의 모델 풀입니다. 평가 기준을 작성하는 모델, 후보 답변을 생성하는 두 모델, Decision-1이라는 도구 호출을 내보낸 뒤 실행되기 전에 채점하는 모델입니다. 제공자 정가는 0% 마크업으로 그대로 전달되므로 생성기 쪽의 가격 인하는 같은 날 우리 쪽에도 적용되며, 자동 장애 조치는 단일 제공자가 성능이 저하될 때 생성 구간을 살려 둡니다. 이는 가끔 사용자에게 응답하는 파이프라인보다 보는 모든 것을 채점하는 파이프라인에서 더 중요합니다. 단일 심사자를 고르고 싶지 않다면, 라우팅 DSL이 여러 모델을 하나의 호출로 구성하며, 모델 퓨전은 이들의 일치도를 읽어야 하는 산문이 아니라 채점된 필드로 보고합니다.

이 글을 바꿔 놓을 것은 표 하나다. Brier 점수와 ECE를 공개하거나 독립적인 실행이 리더보드에 오르게 하면, 위의 평가는 현존하는 유일한 증거가 아니라 확인이 된다. 그때까지 Microsoft-Decision-1에 대해 정확히 말할 수 있는 범위는 좁다: 가중치는 실제로 존재하고, 계약은 대부분의 호스팅 릴리스가 해내는 것보다 더 잘 문서화되어 있으며, 기권 옵션은 나중에 덧붙인 것이 아니라 설계에 포함되어 있고, 성능 주장은 한 문장이다 — 잘 쓰인 한 문장이지만, 어떤 숫자에도 전혀 붙어 있지 않다.
결론
Microsoft-Decision-1은 2026년 10월 8일 Microsoft Foundry에서 일반 공급에 도달했으며, Qwen3.5-9B를 기반으로 구축된 텍스트 전용 32,768토큰 결정 스코어러로서, 출력 토큰이 0이고 다운로드할 가중치도 없이 자체 옵션 세트에 대해 보정된 확률을 반환합니다. 강점은 깔끔한 단일 패스 계약, 설계에 포함된 기권 경로, 그리고 Azure 인증, 청구 및 거버넌스가 결합되어 있다는 점입니다. 약점은 Microsoft를 포함해 Microsoft 외부 누구도 이것이 얼마나 잘 보정되는지에 대한 공개된 수치를 갖고 있지 않다는 것입니다. 이 출시를 역량이 확립된 것으로 취급하지 말고 API가 사용 가능해진 것으로 취급하며, 다운스트림의 어떤 것이 임계값에 의존하기 전에 자체적으로 레이블을 지정한 사례들을 여기에 통과시켜 보세요.
