LLM 점수와 AGI의 거리
LLM 성능 향상이 AGI 전조인지, 외부 도구·기억·계획 결합의 결과인지 공개 자료로 짚는다.
1238개 · 3 / 52페이지
LLM 성능 향상이 AGI 전조인지, 외부 도구·기억·계획 결합의 결과인지 공개 자료로 짚는다.
인간 1인칭 비디오를 로봇 조작에 쓸 때, 행동 복제보다 장면 변화 예측이 더 잘 전이되는지 묻는 EgoWAM 분석
IG-Bench는 과학 아이디어의 계보와 메커니즘 계승을 추적해 AI 평가 기준을 바꾸려는 벤치마크다.
STPA 산출물보다 LLM 분석기 자체 검증이 왜 필요한지와 meta-STPA의 의미를 짚는다.
LLM 합의율을 정확도의 대리 지표로 쓰는 관행에 상관 오류와 동시 오답 비율 관점에서 의문을 제기한다.
지난 수집 자료(공식/뉴스) 중 중요한 링크를 모아 정리했다.
장기 자율 코딩의 핵심은 추론 강화보다 드리프트 통제와 명세 고정, 검토 절차 설계에 있다.
오디오와 생성 전사를 함께 읽는 크로스모달 음성 감정분석의 가치와 한계를 짚는다.
메타의 9월 AI 칩 생산 계획은 모델보다 학습·추론 인프라 통제와 GPU 비용 절감 전략에 초점을 둔다.
미니맥스 차세대 LLM 보도의 핵심은 2조7000억 규모와 오픈웨이트 가능성, 라이선스와 비용 검증이다.
RAID가 NHL 26 골리 AI의 득점 exploit 6개를 한 실험에서 찾아 QA 자동화 가능성을 보여준다.
SPEAR는 Unreal Engine을 Python으로 제어하며 73fps와 14K+ 함수 노출로 연구 생산성과 확장성을 겨냥한다.
한국어 LLM은 한 줄 순위보다 자연스러움·화용론·지시 이행으로 나눠 비교해야 한다.
로봇 형태별 재학습 대신 공통 정책을 쓰는 범용 제어와 zero-shot·sim-to-real 과제를 짚는다.
트랜스포머 VLM의 적대 취약성을 중간 계층 스펙트럼 부분공간으로 해석하는 연구 흐름을 짚는다.
정부와 기업의 비공개 협의만으로 프런티어 AI 출시 안전성을 판단해도 되는지, 검증과 책임의 공백을 짚는다.
지난 수집 자료(공식/뉴스) 중 중요한 링크를 모아 정리했다.
형태가 바뀌는 모듈형 소프트 로봇 팔 제어를 지속학습으로 다룬 arXiv 논문을 살핀다.
같은 모델도 배포 규칙에 따라 집단 행동과 안전성이 달라짐을 보여준 연구를 정리했다.
Gimitest는 변하는 조건에서 RL 정책의 실패, 취약성, 평가 편향을 찾는 통합 테스트 프레임워크다.
에이전트형 AI의 자율성, 도구 호출, 외부 실행을 감독하는 거버넌스 핵심을 짚는다.
LLM을 예측기 대신 의미 주입기로 써 공정 문서와 메타데이터로 예측 적응성을 높이는 접근
합성 모듈러 곱셈과 zero-divisor를 통해 트랜스포머 회로 해석을 가역성 밖으로 넓히는 관점을 정리한다.
HIVE는 VLM 환각이 이후 추론과 판단을 얼마나 오염시키는지 분리해 평가하는 관점을 제시한다.