콜린웍스 이슈 · 주제
AI 이야기.
AI 모델, 코딩 도구, 구독 요금과 사용 한도를 직접 확인한 이야기.
AI 글 28편
최근 글부터.
문서에 답이 없을 때 멈추도록 가르친 AI, Kolibri
독일 Aleph Alpha가 10월 3일 공개한 Kolibri는 문서의 핵심 근거를 가려 놓고도 답하려 하는지 점검하며 훈련한 AI 모델입니다. 근거가 충분할 때는 답하고 부족할 때는 유보하도록 가르쳤습니다. 회사 규정이나 계약서를 읽는 AI라면, 빈칸을 그럴듯한 말로 채우지 않는 능력도 중요합니다.
EU ChatGPT 텍스트에 워터마크, 검출 결과는 어디까지 믿을까
OpenAI의 새 텍스트 워터마크는 글에 자사 AI가 관여했을 가능성을 확인하는 단서입니다. 사람이 얼마나 쓰고 고쳤는지까지 알려 주지는 않습니다. 10월 5일 발표된 textGrain을 과제나 원고 검사에 떠올리게 되는 이유도, 그 결과를 조심해서 읽어야 하는 이유도 여기에 있습니다.
카메라 방향까지 알려주는 제미나이, 혼자 할 수 있는 일이 늘어날까
제미나이 Guided Vision에서 눈길이 가는 것은 AI가 볼 수 있도록 카메라를 맞추는 일까지 도와준다는 점입니다. 구글이 10월 1일 발표한 이 기능은 카메라가 너무 높거나 가깝고 대상이 중심에서 벗어나면 방향을 안내합니다. 이 작은 도움들이 쌓이면 시각장애인이 누군가에게 부탁하던 일 중 일부를 스스로 처리할 수 있지 않을까. 물건을 찾거나 무늬를 확인하는 평범한 순간을 떠올리게 됩니다.
니콘 현미경 영상 1위에 AI 후처리 논란
초록색 섬모 아래로 빨강·파랑·보라색 구조가 보이는 현미경 영상이 니콘 스몰 월드 인 모션 1위에 올랐습니다. 수상 뒤 연구자들이 아래쪽 구조의 모양과 움직임에 의문을 제기했고, 제작자는 이 영역을 AI 후처리로 시각화했다고 설명했습니다. 10월 3일 확인한 공식 갤러리에는 여전히 1위로 올라 있으며, 제목에 AI 후처리 사용이 표시돼 있습니다.
OpenAI DevDay 2026 총정리, 새 모델보다 더 큰 변화는 ‘계속 일하는 AI’였다
Dots, GPT-6.1 Sol, Codex Cloud·Code Review·Security, Agents API, ChatGPT Space·Pages, 플러그인 확장, Pro 500까지. DevDay가 끝난 뒤 공개된 20개 이상의 발표를 기능·가격·지원 플랜·출시 상태까지 다시 정리했습니다.
OpenAI DevDay 2026, 하루 전 Anthropic이 Sonnet 5.5까지 던졌다
OpenAI의 큰 개발자 행사를 몇 시간 앞두고 분위기가 묘해졌습니다. Anthropic이 Opus 5.5에 이어 Sonnet 5.5까지 내놓으면서, 이번 DevDay는 새 기능 구경보다 “OpenAI가 어떤 답을 내놓을까”에 관심이 더 쏠리고 있습니다.
AI 코딩 구독의 5x·20x는 회사마다 분모가 다르다
Claude·ChatGPT·Cursor·Grok·GLM 코딩 구독의 월 요금과 한도 기준을 공식 페이지로 한 표에 모았습니다. 같은 20배라도 무엇의 20배인지가 다르고, 절대 한도를 숫자로 적은 곳은 GLM 하나였습니다.
ChatGPT 월 500달러 요금제 준비 중? Pro Max에서 확인된 것들
OpenAI Codex 공개 코드에는 이미 Pro Max가 들어갔고, 미공개 구독 화면에서는 월 500달러와 ‘Fastest Work and Codex’ 문구가 포착됐습니다. 다만 정식 출시 발표는 아직 없습니다.
Opus 5.5와 GPT-6 Sol·Luna가 같은 날 나왔다, 이번엔 성능보다 가격이 더 눈에 띈다
GPT-6 Sol·Luna는 성능 개선도 있지만 더 큰 변화는 가격이다. Opus 5.5까지 같은 날 비용 효율을 전면에 내세우면서 AI 경쟁의 축이 ‘최고 성능’에서 ‘작업당 비용’으로 넓어지고 있다.
Claude Opus 5.5 발표, 1M 토큰·가격·게임·Three.js 사례까지 정리
1M 컨텍스트와 128K 출력, $4/$20 가격보다 더 눈에 띄는 변화는 장시간 에이전트 작업과 게임·Three.js 결과물에서 보이는 ‘덜 반복하는 능력’입니다.
Grok 4.7 나왔다, 벤치마크는 올랐는데 왜 평가는 갈릴까
Grok 4.7은 코딩·장시간 에이전트 작업 성능을 크게 끌어올렸습니다. 다만 더 높은 추론 설정과 많은 토큰을 쓰는 경향까지 함께 봐야 해서, 숫자만큼 체감 평가가 한쪽으로 모이지는 않습니다.
Jev 열풍 뒤 등장한 Laya, 정말 ‘오픈소스 Jev’일까
Laya는 수십 ms 로컬 결정 모델로 흥미롭지만, ‘Jev보다 정확하다’는 0.766 수치는 해당 업무에 파인튜닝한 specialist 결과입니다. 기본 모델의 제로샷·한국어·고카디널리티 한계까지 함께 봤습니다.
Devin SWE-2가 핫한 이유, 성능보다 더 중요한 건 비용이었다
Cognition의 새 코딩 모델 SWE-2는 상위권 성능과 낮은 실행 비용을 동시에 노립니다. 벤치마크 강점과 한계, 실제 사용 가능 범위를 함께 봤습니다.
Codex Banked Reset, 왜 ‘한 주 추가’가 아닌가
Reset을 누르면 사용량만 차는 게 아닙니다. 그 시점부터 새 주간 사용 창이 시작되고 다음 리셋 날짜도 다시 잡힙니다.
AI 개발 속도 늦추자, 샘 알트먼·머스크·Anthropic까지 동의…무슨 일이 생긴 걸까
누가 더 강한 모델을 먼저 내놓느냐를 두고 경쟁하던 AI 업계에서 뜻밖의 말이 나왔습니다. Anthropic 다리오 아모데이가 프론티어 AI의 능력 향상 속도를 늦추자고 제안했고, OpenAI 샘 알트먼과 일론 머스크, Google DeepMind 데미스 허사비스까지 방향에 동의했습니다. 다만 시진핑까지 이미 합의했다는 이야기는 사실이 아닙니다.
Kimi가 Claude를 몰래 썼다? Anthropic이 공개한 2,300만 건의 기록
Kimi를 사용한다고 생각했는데 실제 답변은 Claude Opus가 만들었다면 어떨까요. Anthropic은 Moonshot AI가 일부 Kimi 사용자 요청을 몰래 Claude로 넘기고, 그 결과와 추론 데이터를 모델 훈련에 활용했다고 주장했습니다. 단순한 ‘증류 의혹’보다 사용자 데이터가 어디로 갔느냐가 더 큰 쟁점입니다.
ChatGPT Pro 20X 신규 가입 일시 중단, 월 200달러 요금제 왜 막혔나
ChatGPT에서 가장 비싼 개인용 요금제인 Pro $200, 이른바 Pro 20X의 신규 가입이 막혔습니다. 원인도 공개됐습니다. Astra 수요가 예상보다 훨씬 커졌고, 시스템 부담이 가장 큰 20X 신규 유입을 먼저 막아 기존 이용자의 접속 품질을 지키겠다는 조치입니다.
GPT Image 2.5 출시, 뭐가 달라졌나? 속도·편집·Flare·Sunburst 총정리
며칠 전까지만 해도 출시 임박설이었다. 이제는 공식이다. OpenAI가 9월 8일 ChatGPT Images 2.5를 발표했다. 최대 50% 빨라진 생성 속도도 눈에 띄지만, 이번 업데이트의 중심은 원하는 부분만 바꾸고 여러 번 수정해도 원본을 더 잘 유지하는 ‘편집’에 가깝다.
Grok Imagine 첫 프레임·마지막 프레임 출시, 이제 두 장면 사이를 영상으로 만든다
Grok Imagine Video 1.5에 시작 프레임과 종료 프레임을 함께 고정하는 기능이 들어왔다. 단순 이미지 투 비디오와 무엇이 달라졌는지, 루프 영상에는 어떻게 쓸 수 있는지 공식 문서를 기준으로 정리했다.
Claude Fable 5.2 벌써 나온다고? 5.1 출시 6일 만에 도는 이야기 확인해보니
Claude Fable 5.1이 9월 1일 공개됐는데 벌써 Fable 5.2라는 이름이 돌고 있다. 9월 7일 현재 Anthropic의 공식 발표도, 모델 카드도, API 모델 ID도 없다. 다만 9월 5일 한 유출 계정이 “Astra에 답할 주요 릴리스”를 언급하면서 이야기가 커졌다. 지금 확인되는 것과 아직 믿으면 안 되는 것을 나눠봤다.
앤트로픽이 intent.md를 AI 네이티브 개발의 출발점으로 제안했다
CLAUDE.md도 있고 AGENTS.md도 있는데 이번에는 intent.md다. 앤트로픽은 2026년 8월 공개한 AI-Native SDLC 플레이북에서 이 파일을 ‘새 설정 파일’이 아니라, 무엇을 왜 바꾸려는지 먼저 고정하는 버전 관리형 proto-spec으로 제안했다. 핵심은 파일 이름보다 구현 전에 의도와 제약을 남기는 데 있다.
GPT-6 Astra, 설정부터 다시 봐야 한다
결과물 자랑보다 먼저 볼 게 있습니다. 전역 지침은 그대로 둬도 되는지, 추론은 무조건 높여야 하는지, 긴 작업의 문맥은 어떻게 유지할지입니다. 공개 이틀째 기준으로 공식 문서와 초기 사용자 반응을 맞춰봤습니다.
GPT-6 Astra 늦게 열리면 하루마다 Codex 리셋권 1개, 대상과 사용법
OpenAI가 GPT-6 Astra 순차 배포를 기다리는 유료 ChatGPT 계정에 하루당 banked reset 1개를 주기로 했다. Astra를 바로 여는 초대권이나 API 크레딧이 아니라, Codex의 5시간·주간 사용량을 다시 시작하는 저장형 리셋권이다.
GPT-6 Astra 발표, 99.9%보다 중요한 건 컴퓨터를 직접 쓰는 능력
OpenAI가 GPT-6 Astra를 공개했다. ARC-AGI-3 99.9%와 ExploitBench 100%가 먼저 눈에 띄지만, 공식 벤치마크·독립 평가·X 얼리 액세스 사례를 함께 보면 핵심은 단순한 답변 점수보다 브라우저와 코딩 도구를 오가며 결과물을 끝까지 완성하는 능력에 있다.
앤트로픽이 Fable 5.1을 코딩과 지식 일의 일반 공개 모델로 소개했다
클로드 Fable 5.1은 앤트로픽이 2026년 9월에 일반 공개한 모델이다. 회사는 코딩과 지식 일에서 지금 가장 앞선 모델이라고 소개했다. 같이 나온 Mythos 5.1은 같은 모델이고 세이프가드만 다르다. 벤치 숫자는 회사가 올린 평가다. 입력·출력 단가는 Fable 5와 같고, 캐시 읽기만 75% 싸다.
GLM 코딩플랜의 100만은 토큰 계산 단위다
GLM Coding Plan은 Z.ai가 코딩 도구용으로 파는 월정액이다. 문서의 100만은 크레딧을 뿌리는 수량이 아니다. 토큰 100만 단위로 크레딧을 깎는 식과, 컨텍스트 100만이다. 지금 플랜에서 열리는 모델은 GLM-5.3과 GLM-5.3-Flash다.
같은 20x인데 Claude랑 Codex가 다르다고?
Threads에서 이런 글을 봤습니다. Claude Max 20x랑 Codex 20x가 같은 20배가 아니라는 거였어요.
같은 Grok 4.6인데 Cursor랑 Build가 다르다?
X에서 이런 글을 봤습니다. 같은 Grok 4.6 xHigh인데 Build랑 Cursor 결과물이 다르다는 거였어요.