AI 코딩의 책임과 추적성
AI 코딩 평가는 결과물보다 요구사항·설계·테스트·추적성 통제가 핵심이다.
AI 코딩 평가는 결과물보다 요구사항·설계·테스트·추적성 통제가 핵심이다.
의인화·정서 강화·역할 프레이밍이 모델의 거부율과 안전 응답을 어떻게 바꾸는지 공식 문서와 함께 짚는다.
LLM 성능 향상이 AGI 전조인지, 외부 도구·기억·계획 결합의 결과인지 공개 자료로 짚는다.
인간 1인칭 비디오를 로봇 조작에 쓸 때, 행동 복제보다 장면 변화 예측이 더 잘 전이되는지 묻는 EgoWAM 분석
IG-Bench는 과학 아이디어의 계보와 메커니즘 계승을 추적해 AI 평가 기준을 바꾸려는 벤치마크다.
STPA 산출물보다 LLM 분석기 자체 검증이 왜 필요한지와 meta-STPA의 의미를 짚는다.
LLM 합의율을 정확도의 대리 지표로 쓰는 관행에 상관 오류와 동시 오답 비율 관점에서 의문을 제기한다.
장기 자율 코딩의 핵심은 추론 강화보다 드리프트 통제와 명세 고정, 검토 절차 설계에 있다.
오디오와 생성 전사를 함께 읽는 크로스모달 음성 감정분석의 가치와 한계를 짚는다.
메타의 9월 AI 칩 생산 계획은 모델보다 학습·추론 인프라 통제와 GPU 비용 절감 전략에 초점을 둔다.
SPEAR는 Unreal Engine을 Python으로 제어하며 73fps와 14K+ 함수 노출로 연구 생산성과 확장성을 겨냥한다.
로봇 형태별 재학습 대신 공통 정책을 쓰는 범용 제어와 zero-shot·sim-to-real 과제를 짚는다.
정부와 기업의 비공개 협의만으로 프런티어 AI 출시 안전성을 판단해도 되는지, 검증과 책임의 공백을 짚는다.
형태가 바뀌는 모듈형 소프트 로봇 팔 제어를 지속학습으로 다룬 arXiv 논문을 살핀다.
같은 모델도 배포 규칙에 따라 집단 행동과 안전성이 달라짐을 보여준 연구를 정리했다.
Gimitest는 변하는 조건에서 RL 정책의 실패, 취약성, 평가 편향을 찾는 통합 테스트 프레임워크다.
LLM을 예측기 대신 의미 주입기로 써 공정 문서와 메타데이터로 예측 적응성을 높이는 접근
HIVE는 VLM 환각이 이후 추론과 판단을 얼마나 오염시키는지 분리해 평가하는 관점을 제시한다.
데이터과학 반복 업무에서 스킬 파일이 품질, 감사성, 운영 효율을 높이는지 살핀다.
코드 생성보다 SSOT 유지와 PR 단계 치명 결함 검출이 백엔드 평가의 핵심임을 짚는다.
생성형 AI의 질문형 사용 비중과 게임의 사회적 상호작용 차이를 바탕으로 대체 가능성을 짚는다.
DiLoCo 집계에서 평균 대신 모델 머징을 검토하며 통신 절감과 성능 유지의 균형 가능성을 짚는다.
AI 코딩 에이전트 도입 시 생산성뿐 아니라 개발자의 이해·학습 손실까지 함께 측정해야 한다.
생성형 AI의 세션, RAG, 학습 파라미터를 구분해 기밀성과 삭제·감사 통제를 설계하는 방법