LLM 에이전트 메모리 입장제어
장기 메모리 오염을 줄이고 감사성을 높이는 LLM 에이전트 메모리 입장제어 설계와 계측을 정리한다.
장기 메모리 오염을 줄이고 감사성을 높이는 LLM 에이전트 메모리 입장제어 설계와 계측을 정리한다.
의료 멀티모달 추론은 평균 점수보다 grounding·실패 모드·감사 로그 중심 통제 평가가 핵심이다.
PDF 표 추출은 입력 방식·용량 제한·시각 분석 여부에 따라 결과가 달라져 구조 지표 기반 평가가 필요하다.
웹검색·추론 모드가 정확도·재현성·응답시간에 주는 트레이드오프와 검증 절차를 정리한다.
110k 토큰·30MB 제한 속 장문 보고서는 검색(근거)과 서술(논리)을 분리해 분할 루프로 품질·감사를 높인다.
폴란드어 11B 모델에서 2-bit PTQ 6종을 비교, 지표와 생성 붕괴 괴리를 분석.
에이전트 장기 실행에서 목표 드리프트를 측정하고 HAT 불확실성을 줄이는 운영 지표를 정리한다.
트리거 유무에 따라 EM이 0.0–1.0%에서 12.2–22.8%로 급변해 평가 사각지대가 생긴다.
연속학습 망각을 정확도뿐 아니라 구조적 붕괴·가소성 상실로 해석하고 eRank로 추적한다.
GPS·텔레메트리 없이 UAV 단안 영상에서 차량을 앵커로 GSD를 추정해 절대 스케일을 복원한다.
ChatGPT 기본 모델 교체로 톤·거절·창의성이 달라질 수 있다. 가드레일과 표현 균형을 점검하자.
LLM이 쉽게 푸는 과제가 만드는 난이도 착시와 다중지표·프로토콜 기반 평가/게이트 설계법
부분관측 TAMP에서 과업 비관련 객체도 반영해 LLM로 belief를 보강하고, 캘리브레이션·안전필터로 신뢰성을 다룬다.
LLM 연구 에이전트 루프에서 정식화 병목을 줄이려면 로그·지속평가·도구정확도 지표가 핵심이다.
경영 조언에서 모호성 감지·명확화와 시코팬시 억제가 품질·책임에 미치는 영향과 평가 지표를 정리.
AI 구독은 가격보다 한도·약관·업타임 공개를 점검해 업무 중단 위험을 줄이는 최소 조합이 핵심이다.
도구 금지·확대 금지 같은 퍼즐평가 제약은 문장보다 API 설정과 로그로 고정해야 재현된다.
NVML/DCGM/nvidia-smi는 구간 평균·비율이다. 1Hz 로깅에서 LLM 추론 전력 변동을 해석한다.
AI의 노력 대체는 인지 자동화와 신체·뇌 증강으로 나뉜다. 근거와 규제로 과장을 가린다.
공감·기억·일관성 설계가 친밀감과 신뢰에 미치는 영향과 안전 평가 기준을 정리합니다.
LLM 도입·전환 시 장애 공지, RCA, 도구 호출 통제, 재시도·SLO로 운영 안정성을 평가하는 법.
LLM의 모사와 자기 일관성을 분리해 장기 기억·페르소나 드리프트를 벤치마크로 평가하는 방법.
검색 AI가 답변 중심에서 캔버스형 작업공간으로 옮겨가며 초안과 도구 제작이 검색 안에 들어온다.
단편 지식을 붙여넣고 이해 점검→구조화 설명→퀴즈로 학습을 대화 루프로 잇는 방법.