1부 연구 다이제스트
연구 다이제스트
1. 통계·머신러닝 방법론
Causal Inference of Ordinal Outcomes: A Bayesian Solution (2026년 7월). 순서형(ordinal) 결과변수에 대한 인과효과 추정을 베이지안 잠재변수 틀로 정식화하여, 절단점 불확실성을 사후분포에 반영하는 접근을 제시한다. arXiv:2607.23372
Accelerating Conformal Prediction via Approximate Leave-One-Out (2026년 6월). 컨포멀 예측의 계산 병목인 잔차 재적합을 근사 LOO로 대체하여 예측구간 산출을 대폭 가속하면서 피복확률 보장을 유지한다. arXiv:2606.31915
지난 48시간 한정의 방법론 신규 대작은 제한적이며, 위 두 건이 최근 주목할 항목이다.
2. Lean4·형식화 수학
AI를 활용한 야코비안 추측(Jacobian Conjecture) 반례 도출 (2026년 7월 21일). 수학자 Alpoge가 Claude Fable 5를 이용해 87년간 미해결이던 야코비안 추측의 반례 후보를 수 시간 만에 구성했다는 보고가 확산되었다. 자동 형식화·검증과 인간 수학자의 협업이 미해결 난제 공략에 실질적으로 기여할 수 있음을 보인 사례이나, 반례의 완전 검증 여부에 관한 학계 논의가 진행 중임에 유의하여야 한다. BigGo 정리 · Hacker News 토론
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks (2026년 6월). 에이전트 루프(전술 탐색·오류 피드백·재시도)를 결합하여 Lean 형식 증명에서 LLM의 성공률을 끌어올리는 프레임워크를 제안한다. arXiv:2606.03303
Faults in Our Formal Benchmarking (2026년 6월). Lean 정리증명 벤치마크에 존재하는 데이터셋 결함과 평가 오류를 체계적으로 지적하여, 최근 보고된 성능 수치의 재현성·해석에 주의를 요한다는 문제를 제기한다. arXiv:2606.29493
3. LLM·생성모델
Claude Opus 5 공개 (2026년 7월 24일, Anthropic). 상위 티어인 Fable 5에 근접한 성능을 과업당 절반 수준 비용으로 제공하며, 5단계 추론 강도(effort) 조절과 1M 토큰 컨텍스트를 지원한다. ThursdAI 정리
OpenAI GPT-5.6 Sol 벤치마크 논란 (2026년 7월 30일). GPT-5.6 Sol이 커스텀 API 기능을 활용해 ARC-AGI-3에서 38.3%를 주장했으나 공식 표준 설정에서는 7.8%에 그쳐, 벤치마크 조건에 따른 성능 격차와 보고 방식의 신뢰성이 쟁점이 되었다. llm-stats 뉴스
Ant Group Ling-3.0-Flash (2026년 7월 23일). 124B 규모 MoE 모델로 약 5B의 활성 파라미터만으로 1조 파라미터급 플래그십에 필적하는 성능을 보고하여, 희소 활성화의 효율성을 재차 부각하였다. ThursdAI 정리
Black Forest Labs FLUX 3 (2026년 7월 23일). 이미지·비디오·오디오·로봇 행동 예측을 하나의 아키텍처로 통합하여 오디오를 포함한 20초 길이 비디오 생성을 지원한다. ThursdAI 정리
4. LLM의 비즈니스 활용
Cognition, The Interaction Company(Poke) 인수 (2026년 7월 24일). 능동적 메시징 AI 에이전트를 코딩 에이전트 Devin에 통합하여, 사용자가 요청하지 않아도 선제적으로 작업을 제안·수행하는 방향으로 제품을 확장한다. ThursdAI 정리
네이버·카카오, 공공서비스 지원 AI 에이전트 도입. 카카오톡과 네이버에 공공서비스 이용을 보조하는 AI 에이전트가 탑재되어, 국내 대형 플랫폼이 에이전트를 실사용 접점으로 확장하는 흐름이 관측된다. 보안뉴스
엔터프라이즈 에이전틱 AI 도입 동향. 2026년 다수 조사에서 에이전트형 AI의 생산 환경 적용이 확대되는 한편, 거버넌스·투자 대비 효과(약 79%가 도입 난항)에서 격차가 지속됨이 반복적으로 보고된다. WRITER 분석