vllm, mlx-vllm은 8비트 양자화 모델로컬장비: M5 Pro 16inch 64GB RAM 사용자 프롬프트: 하이 모델 서빙ollama: 답변하는데 3분넘게걸림, 메모리 55기가vllm: 답변 1~3분, 메모리 55기가 + 스왑 10기가 (최악)mlx-vlm: 답변 1분, 메모리 가장 준수 대략 55기가 사용 AI 에이전트qwencode(qwen official) -> 입력토큰 21921opencode -> 입력토큰 10285 평균속도 (mlx-vlm + opencode 조합)prefill(프롬프트 조회): 421tokens/sgeneration(프롬프트 생성): 9.25tokens/s 최적조합mlx-vlm + opencode메모리가 남는다면 MTP 모델을 별도로 추가하여 성능 업 가능