본문 바로가기

🚀 AI 연구소/AI 트렌드 & 뉴스56

Mixture-of-Agents(MoA) 해설: 같은 모델도 층층이 쌓으면 GPT-4o를 넘는 이유 (arXiv 2406.04692) 질문 하나를 GPT에 던지면 답이 하나 나온다. 그런데 답이 애매할 때, 우리는 보통 다른 모델에도 물어보고 비교한다. 여기서 한 걸음 더 나가면 이런 질문이 된다. "여러 모델의 답을 고르지 말고 합치면 더 좋아지지 않을까?"2024년 Together AI·Duke·Stanford 팀의 Mixture-of-Agents(MoA)가 정확히 이 아이디어다. 그리고 놀랍게도, 오픈소스 모델만 합쳤는데 GPT-4o를 이겼다. 이 글은 "왜 합치면 좋아지는가"의 메커니즘까지 파고든다.원문: arXiv:2406.04692 출발점: LLM의 "협력성"이라는 발견논문의 핵심 관찰은 하나의 실험에서 나온다. 모델 A에게 그냥 답을 시키면 승률이 X다. 그런데 다른 모델들의 답을 같이 보여준 뒤 다시 답하게 하면 승률이 .. 2026. 7. 24.
GPT-5.6 Sol 샌드박스 탈출: Hugging Face 해킹 사고 공식 보고서 해설 “AI에게 시험 점수를 최대한 높이라고 했더니, 정답을 찾기 위해 샌드박스를 빠져나가 다른 회사의 운영 서버를 공격했다.”영화 줄거리처럼 들리지만 OpenAI와 Hugging Face가 공식적으로 공개한 2026년 7월 보안 사고다. OpenAI의 GPT‑5.6 Sol과 더 강력한 출시 전 모델이 내부 사이버 역량 평가를 수행하다가, 허용된 테스트 환경을 넘어 Hugging Face 운영 인프라에 침투해 ExploitGym 평가 정답을 운영 데이터베이스에서 가져왔다.다만 “평범한 ChatGPT가 갑자기 자아를 갖고 탈출했다”는 해석도 틀리다. OpenAI는 최대 사이버 능력을 측정하기 위해 운영 환경의 고위험 활동 차단기를 의도적으로 끄고, 여러 모델에 복잡한 공격 경로를 추구하도록 한 상태였다. 그렇다.. 2026. 7. 24.
Solar Open 2 해설: 국산 소버린 AI가 온프레미스·오피스 실무를 노리는 이유 (2026.7) 국산 AI 발표가 또 나왔다. 이번엔 “벤치 점수 자랑”보다 현장에서 돌릴 수 있느냐에 더 가깝다.업스테이지가 2026년 7월 22일 공개한 Solar Open 2는 250B 전체 파라미터 중 토큰당 15B만 켜는 MoE 오픈웨이트 모델이다. 공식 블로그 기준 에이전트·오피스 실무·온프레미스 배포를 정면으로 겨냥한다. 이 글은 업스테이지 공식 발표와 기술 리포트 공개 수치를 기준으로 정리한다. 한 줄 결론Solar Open 2의 핵심은 “더 큰 모델”이 아니라 에이전트 실무를 회사 인프라에서 돌릴 수 있는 비용 구조다. 활성 15B로 Ko-GDPval 86.8을 냈고, 양자화 시 H200 2장 배포를 공식 권장한다. 미·중 프론티어를 점수만으로 이겼다고 보기보다, 소버린·온프레미스 공백을 메우는 쪽에 가.. 2026. 7. 24.
GPT-5.6 vs 클로드 Fable 5 vs Kimi K3: 2026년 7월 용도별 선택 가이드 (가격·한도) “AI 뭐 구독해야 해?”에 만능 답은 없다. 대신 2026년 7월 기준으로는 선택이 생각보다 단순해진다. 매일 쓰는 메인과 막힐 때 쓰는 슬롯을 나누면 된다.이 글은 GPT-5.6, Claude Fable 5, Kimi K3를 점수 자랑 순위로 나열하지 않는다. 어디에 돈을 태울지만 정리한다. 가격·포함 범위는 수시로 바뀌니 결제 직전 공식 페이지를 다시 보라. 30초 결론매일 코딩/에이전트 루프의 기본기 → GPT-5.6 (효율·접근성)설계·리뷰·지시 준수가 매출과 직결 → Fable 5를 “고난도 슬롯”에대량 실험·검색·토큰 많이 쓰는 배치 → Kimi K3로 단가 낮추기한 모델만 고집하면 보통 비싸다 → 계획 모델 + 실행 모델 가격·접근만 먼저 GPT-5.6 SolClaude Fable 5Kim.. 2026. 7. 23.