-
14추천
-
11추천
-
9추천
-
12추천
-
10추천링크LangGraph 같은 프레임워크 쓰다가 직접 while 루프로 짜는 게 낫다는 글을 봤는데요. 디버깅이 쉽고 의존성이 적다는 게 이유라네요. 다들 어떻게 생각하세요?
-
8추천이미지 링크코드 문서는 300토큰, 일반 문서는 500~800토큰으로 쓰고 있는데요. 법률 문서처럼 구조화된 건 섹션 단위로 자르는 게 낫다는 의견도 있더라고요. 다들 어떻게 하세요?
-
12추천이미지 링크8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
-
9추천
-
10추천
-
9추천이미지 링크인터넷이 안 되는 환경에서 LLM+RAG를 돌려야 하는 프로젝트였는데, Ollama + 로컬 임베딩으로 구성했습니다. 오프라인 배포에 관심 있으신 분들께 도움이 되길.
-
7추천이미지 링크둘 다 써봤는데, Open-webui는 Ollama 연동이 편하고 LibreChat는 멀티모델 관리가 좋았습니다. RAG 기능은 LibreChat가 좀 더 성숙한 느낌? 여러분 선택은?
-
13추천
-
8추천
-
10추천이미지 링크로컬 RAG 서비스 최소 구성 템플릿을 만들어봤습니다. docker compose 하나로 Ollama + FastAPI + ChromaDB가 뜹니다. 피드백 환영해요.
-
9추천
-
8추천
-
1추천
-
7추천
-
11추천링크코딩 테스트 통과율이 예전보다 확실히 높아진 느낌. AI 도구 사용을 허용할지, 아니면 역량 평가 방식을 바꿔야 할지 고민입니다.
-
11추천
-
7추천
-
7추천
-
12추천링크2.8T 파라미터면 DeepSeek V4 Pro보다 75% 크다고 합니다. 1M 컨텍스트 + 항상 켜진 추론 모드. 오픈소스가 이제 안 따라잡히네요.
-
12추천가격 대비 성능이 미쳤다. $0.14/M in. 로컬 vLLM 대신 API로 갈아탈까 고민 중.
-
6추천링크보안 우려로 LLM 도입을 꺼리시는 분들이 있는데, 폐쇄망 배포 사례를 보여드리면 좀 나아질까요? 비슷한 경험 있으신 분들의 조언 부탁드립니다.
-
9추천링크솔직히 이번 건 좀 궁금하네요. 정부가 어떻게 안전하다고 결론 내렸는지 과정이 투명하지 않다는 지적. 원문 공유합니다.
-
6추천
-
16추천폐쇄망용 완전 오프라인 RAG. Ollama만으로 동작, 임베딩은 bge-m3. 피드백 환영합니다.
-
8추천링크사내용 챗봇 하나 돌리는데 GPU 서버 빌리는 게 월 200만원이 넘네요. 트래픽이 적으면 API 쓰는 게 이득이라는 의견도 있고요. 실제 사례 있으면 공유 부탁드려요.
-
9추천보안 때문에 전부 온프레미스로. bge-m3 + Qwen2.5-14B로 구축했고, 사용자 만족도 4.2/5 나왔어요. 후기 공유합니다.
-
8추천드디어 에이전트 전용 API가 나왔네요. MCP 서버가 기본 지원이라 도구 연동이 쉬워질 듯. 개발자 문서부터 읽어봐야겠어요.
-
8추천링크Mira Murati가 세운 회사가 시드로 2조원대 유치. a16z 리드. 시장 분위기가 확실히 달라졌네요.
-
7추천링크상업적으로 사용할 수 있는 오픈 LLM의 업데이트된 목록입니다. 클라이언트 프로젝트용 모델을 고를 때 유용합니다.
-
9추천노트북에서 돌리는 Ollama는 간단한 테스트용으로는 훌륭하지만, 안정성이 필요해지면 호스팅 API가 지연 시간과 업타임에서 더 낫다. 지금까지의 내 경험상 그렇다는 얘기다.
-
5추천
-
7추천네임스페이스 API가 안정화됐고 성능도 올라갔다고 합니다. 마이그레이션 가이드 공유합니다.
-
8추천금융권 고객사에 설치했습니다. 인터넷 완전 차단 환경에서도 임베딩+검색+생성 전부 동작. 자세한 내용은 글에.
-
8추천모든 프레임워크는 500줄을 넘어서면 디버깅 악몽이 됩니다. 순수 코드 + function calling이 우리에게는 더 좋았습니다.
-
7추천모든 데이터는 기기에 저장됩니다. 주제, 기분, 실행 항목이 담긴 주간 다이제스트. 2주 만에 사용자 400명!
-
7추천가성비 미쳤습니다. 4bit로 12GB 램 노트북에서 돌아간다고 하니 로컬 실험용으로 딱이네요.
-
7추천
-
8추천비용/지연/프롬프트 버전까지 한 번에 보이니까 디버깅 시간이 반으로 줄었습니다. 무료 티어로 충분해요.
-
8추천한국어 문서 검색인데 bge-m3 vs multilingual-e5 고민입니다. 경험 공유 부탁해요.
-
9추천MathBench 리더보드가 또 뒤집혔네. 오픈소스 격차가 예상보다 훨씬 빠르게 좁혀지고 있어.
-
6추천LLM이 스트리밍으로 출력할 때 JSON을 점진적으로 파싱하는 방법 질문입니다. partial JSON 파서 쓰시는 분 계신가요?
-
6추천
-
6추천링크의사용 AI 스크라이브가 53억 달러 가치 평가로 막 대규모 투자 유치에 성공했다. 헬스케어 AI가 확실히 진짜 돈이 되는 분야인가 보다.
-
8추천도메인 용어가 많은데 파인튜닝이 나을지 RAG가 나을지. 둘 다 해보신 분들 의견 궁금합니다.
-
6추천LLM을 잘 쓰는 것만으로는 부족하다는 말이 많아지네요. 시스템 설계? 벡터 DB? MLOps? 다들 뭐가 우선이라 생각하세요?
-
9추천Ticket deflection이 한 달 만에 0%에서 38%로 증가했습니다. 아키텍처와 우리가 저지른 실수들을 공유합니다.