Table of Contents

পণ্যের লেবেলে 32GB লেখা থাকলেই Qwen 27B কাজের জন্য 32GB পাওয়া যায় না। অপারেটিং সিস্টেম, রানটাইম, KV cache, মডেল ফরম্যাট, ড্রাইভার স্ট্যাক এবং কার্ডের বিন্যাস ফল বদলে দেয়। যথেষ্ট ক্ষমতার সস্তা কার্ডও prompt processing বা সেটআপের সময়ে অনেক পিছিয়ে পড়তে পারে।

অক্টোবর 2026-এ শুধু VRAM সংখ্যা নয়, ব্যবহারযোগ্য মেমরি এবং প্রতি ডলারে সম্পন্ন কাজ তুলনা করুন।

এই গাইডে বড় কনটেক্সট উইন্ডার সঙ্গে 6-bit মানে Qwen 27B চালানোর ব্যবহারিক পথগুলো দেখানো হয়েছে। প্রকাশিত স্পেসিফিকেশন এবং রিপোর্ট করা পরীক্ষার ফল আলাদা রাখা হয়েছে। একজনের tokens-per-second ফল কোনো GPU-এর সার্বজনীন বৈশিষ্ট্য নয়।

কেন লক্ষ্য 32GB

মেমরির প্রয়োজন শুরু হয় weights দিয়ে। একটি dense 27B মডেল generation-এর সময় পুরো parameter set পড়ে। 6-bit quantization-এ runtime allocation এবং context memory যোগ করার আগে weights প্রায় 20.5GB জায়গা নেয়।

128K-token context আরও বড় allocation যোগ করে। মডেল architecture, cache precision, batch settings এবং backend অনুযায়ী KV-cache-এর সঠিক আকার বদলে যায়। প্রায় 8GB-এর ব্যবহারিক হিসাব weights এবং cache মিলিয়ে প্রায় 28.5GB দেয়। এরপর অপারেটিং সিস্টেম এবং inference runtime-এর জন্য জায়গা দরকার।

কনফিগারেশনকী সমর্থন করে
24GB discrete GPUকম context-সহ 4-bit weights, অথবা আংশিক offload
32GB discrete GPUব্যবহারযোগ্য 128K context লক্ষ্যসহ 6-bit weights
দুটি 16GB GPUruntime overhead-এর জন্য কম headroom-সহ ভাগ করা মডেল
64GB unified memoryবড় context এবং মডেলের বিকল্প, GPU memory allocation limit-এর অধীন

32GB একটি sizing point, নিশ্চয়তা নয়। মডেল load হলেও দীর্ঘ prompt, বড় batch, multimodal input অথবা দ্বিতীয় process-এর জন্য খুব কম জায়গা থাকতে পারে।

ভিডিওটি একটি কার্যকর field reference

পরের ভিডিওতে লোকাল AI-এর জন্য 32GB পাওয়ার প্রধান পথগুলোর হাতে-কলমে তুলনা আছে। রিপোর্ট করা দাম, সেটআপের ঝামেলা এবং runtime ফল বোঝার জন্য এটি field reference হিসেবে কার্যকর। এই নিবন্ধে hardware specification, মডেলের memory behavior, software support এবং মোট ownership cost দিয়ে আলাদা তুলনা করা হয়েছে।

ব্যবহারযোগ্য মেমরি box memory-এর চেয়ে গুরুত্বপূর্ণ

Apple unified memory

Apple silicon CPU এবং GPU-এর জন্য একটি shared pool ব্যবহার করে। Apple 32GB unified-memory Mac mini configuration তালিকাভুক্ত করে, কিন্তু পুরো pool dedicated graphics allocation নয়। macOS, application এবং inference runtime-এরও জায়গা লাগে।

কিছু llama.cpp session 32GB system-এ প্রায় 22,906MB available দেখায়। এটি প্রায় 21.3GiB, তাই বড় KV cache-সহ 6-bit 27B মডেলের জন্য খুব কম headroom থাকে। সঠিক সীমা অপারেটিং সিস্টেম, model runner, memory pressure এবং launch settings-এর উপর নির্ভর করে।

শান্ত system-এর জন্য Apple silicon এখনও আকর্ষণীয়। llama.cpp Metal-কে first-class backend হিসেবে ব্যবহার করে। Apple অনেক ব্যবহৃত ডেটা-সেন্টার কার্ডের driver এবং power সমস্যা এড়ায়। বিনিময়ে high-end discrete GPU-এর তুলনায় throughput কম এবং memory headroom কম অনুমানযোগ্য।

দুটি 16GB কার্ড

দুটি 16GB কার্ডে 32GB physical VRAM থাকে, কিন্তু runtime-এর per-device buffer এবং communication space দরকার। একটি কার্ড 13.4GB ব্যবহৃত দেখাতে পারে, অন্যটি 14.4GB। বাকি ক্ষমতা context-এর জন্য পরিষ্কার 4GB reserve নয়।

Split method-ও গুরুত্বপূর্ণ। Layer splitting আলাদা মডেল layer আলাদা কার্ডে দেয়। এতে capacity বাড়ে, কিন্তু কার্ডগুলো পালা করে মডেলের মধ্য দিয়ে কাজ করে। Tensor splitting একই layer-এর কাজ দুই কার্ডে রাখে। এতে communication বাড়ে, কিন্তু দুই device সরাসরি বেশি অবদান রাখে।

Split methodপ্রধান সুবিধাপ্রধান খরচ
Layer splitসহজ capacity expansionএকটি কার্ড কাজ করার সময় অন্যটি প্রায়ই অপেক্ষা করে
Tensor splitকিছু workload-এ ভালো parallel computeবেশি tuning এবং বেশি interconnect traffic
CPU plus GPU offloadমোট VRAM-এর চেয়ে বড় মডেল fit করেCPU ঘন ঘন layer সামলালে গতি অনেক কমে

কেনার আগে দুই-কার্ড পরিকল্পনার backend পরীক্ষা করুন। PCIe generation, slot spacing, power delivery, driver support এবং নির্দিষ্ট quantization ফল বদলে দেয়।

একক-কার্ডের বিকল্প

RTX 5090

NVIDIA RTX 5090-এ 32GB GDDR7 এবং 1,792GB/s memory bandwidth উল্লেখ করে। এতে বিস্তৃত CUDA support, পরিণত tooling এবং বহু পরীক্ষিত frontend আছে। বর্তমান CUDA GPU table RTX 5090-কে compute capability 12.0 হিসেবে দেখায়।

সমস্যা হল দাম। নতুন 5090 32GB পাওয়ার পরিষ্কার পথ দেয়, কিন্তু কেনার খরচ কয়েক মাসের rented accelerator time-এর সঙ্গে প্রতিযোগিতা করে। এটি সর্বোচ্চ 575W total graphics power ব্যবহার করে, তাই শক্তিশালী power supply এবং cooling দরকার।

Radeon AI PRO R9700

R9700 হল high memory bandwidth-সহ 32GB-class AMD option। অনেক listing-এ এর entry price 5090-এর চেয়ে কম। এর মূল্য runtime-এর উপর অনেক নির্ভর করে। Default llama.cpp path ব্যবহারযোগ্য ফল দেয়, আর কিছু reported test-এ দ্রুত community backend একই কার্ডে অনেক বেশি ফল দেয়।

GPU তুলনায় দুইটি speed column কেন দরকার, এর স্পষ্ট উদাহরণ এটি। Decode speed generated token মাপে। Prefill speed প্রথম generated token-এর আগে backend কত দ্রুত prompt পড়ে তা মাপে। 50,000-token codebase decode গ্রহণযোগ্য দেখালেও দুর্বল prefill path প্রকাশ করে।

Intel Arc Pro B70

Arc Pro B70 32GB memory নিয়ে professional workload লক্ষ্য করে। Capacity-per-dollar হিসেবে এটি আকর্ষণীয়, কিন্তু CUDA hardware-এর চেয়ে software path বেশি যাচাই করতে হয়। Standard GGUF support, patched build, draft-token settings এবং backend maturity ফল বদলে দেয়।

কম purchase price কাজ করা build খুঁজতে ব্যয় করা ঘণ্টার ক্ষতিপূরণ দেয় না। Tinkerer-এর জন্য এই কাজ project-এর অংশ। প্রতিদিনের workstation-এর জন্য driver এবং application support-এর বাস্তব মূল্য আছে।

ব্যবহৃত ডেটা-সেন্টার কার্ড

Tesla V100

ব্যবহৃত 32GB Tesla V100 আকর্ষণীয়, কারণ কার্ডের দাম কম মনে হয়। সম্পূর্ণ build-এর দাম বেশি। Passive data-center card-এর airflow, উপযুক্ত chassis বা shroud, power adapter এবং যথেষ্ট PCIe space-সহ host দরকার।

আরেকটি সমস্যা software-এর বয়স। বর্তমান CUDA GPU table নতুন architecture-এ জোর দেয় এবং বর্তমান architecture table-এ V100 তালিকাভুক্ত করে না। কেনার আগে exact CUDA release, driver branch, backend এবং community fork যাচাই করুন।

শুধু bare card নয়, কার্যকর V100 system-এর বাজেট করুন। প্রায় 680 ডলারের কার্ড cooling, adapter এবং host platform যোগ হলে প্রায় 1,000 ডলারের project হতে পারে। জনপ্রিয় local-AI workload একই অবসরপ্রাপ্ত accelerator-এর দিকে ক্রেতাদের ঠেলে দিলে ব্যবহৃত দামও বাড়ে।

AMD Instinct MI50

MI50 প্রতি gigabyte-এ আকর্ষণীয় used price দেয়, কিন্তু বর্তমান software support বড় সীমাবদ্ধতা। পুরনো ROCm stack বা community-maintained fork-নির্ভর কার্ড mainstream application support-সহ বর্তমান consumer card-এর সমান নয়।

Prompt-processing gap sticker price-এর চেয়ে গুরুত্বপূর্ণ। একটি তুলনায় prompt-processing workload-এ MI50-এ প্রায় 128 tokens per second, নতুন 32GB card-এ প্রায় 2,652 tokens per second মাপা হয়েছিল। 50,000-token codebase generation শুরুর আগে ধীর পথে কয়েক মিনিট এবং দ্রুত পথে কয়েক সেকেন্ড নিতে পারে।

MI50 একটি সংকীর্ণ use case-এর জন্য উপযুক্ত। Capacity-কে interaction speed-এর চেয়ে বেশি গুরুত্ব দেওয়া এবং driver maintenance গ্রহণ করা builder-এর জন্য এটি মানানসই। Prefill time গুরুত্বপূর্ণ হলে দ্রুত codebase analysis-এর জন্য এটি খারাপ পছন্দ।

Software-ও GPU-এর অংশ

llama.cpp CUDA, HIP, Metal, Vulkan, SYCL এবং অন্যান্য backend সমর্থন করে। CPU plus GPU hybrid inference এবং multi-GPU-ও সমর্থিত। Vendor এবং model format ভেদে এই feature-গুলোর performance এক নয়।

একই physical card-এ প্রায়ই বড় পার্থক্য দেখা যায়:

  • Default application build, conservative settings-সহ।
  • Tuned llama.cpp build, backend-specific kernel-সহ।
  • Community fork, speculative বা multi-token prediction-সহ।
  • Patched model format, একটি accelerator path-এর জন্য তৈরি।

সরবরাহ করা তুলনার reported result-এ default 32GB AMD path-এ প্রায় 27 tokens per second, multi-token prediction-এ প্রায় 46 tokens per second, এবং specialized backend-এ আরও বেশি ফল অন্তর্ভুক্ত আছে। এটি software headroom-এর প্রমাণ। নতুন installation-এ একই ফলের প্রতিশ্রুতি নয়।

প্রতিটি benchmark-এ backend, commit, model file, quantization, context length, prompt length, batch size এবং power state লিখে রাখুন। এই field ছাড়া tokens per second একটি বিজ্ঞাপনী সংখ্যা।

কেনার বদলে ভাড়া

দ্রুত GPU ভাড়া নিলে হিসাব বদলে যায়। প্রায় প্রতি ঘণ্টায় 0.69 ডলার RTX 5090 rental price হলে 4,400 ডলারের purchase বিদ্যুৎ, host hardware, maintenance এবং resale value ধরার আগে প্রায় 6,377 rental hours-এর সমান।

এটি continuous rental-এ প্রায় নয় মাস, অথবা দিনে আট ঘণ্টায় প্রায় দুই বছর। একই rental rate-এ 1,560 ডলারের দুই-কার্ড desktop প্রায় 2,261 ঘণ্টার সমান। Rented 5090 local heat, noise, driver setup এবং card failure-ও এড়ায়।

ব্যবহারের ধরনভালো প্রথম পরীক্ষা
সপ্তাহে কয়েক ঘণ্টাHosted model বা rented GPU
ছোট project5090-class card ভাড়া করে বাস্তব workload মাপুন
দৈনিক interactive useBackend এবং context target পরীক্ষা করার পর কিনুন
রাতভর চলা agentOwned hardware সহজে যুক্তিযুক্ত হয়
নিয়মিত load-সহ private dataNetwork isolation-সহ owned hardware

Model, backend বা context length অনিশ্চিত থাকলে আগে ভাড়া নিন। এক সপ্তাহান্তের measurement ভুল workstation কেনার চেয়ে সস্তা।

কেনার সুপারিশ

দুটি RTX 5060 Ti 16GB

যাদের 32GB দরকার এবং common tutorial, driver ও frontend চান, তাদের জন্য দুটি 16GB card ব্যবহারিক CUDA path দেয়। Model format এবং backend যাচাই করার পরেই tensor splitting ব্যবহার করুন। Layer splitting সহজ, কিন্তু performance প্রায়ই কম ব্যবহার করে।

এই পথে দুইটি ব্যবহারযোগ্য slot-সহ motherboard, পর্যাপ্ত power এবং card-এর মাঝখানে airflow দরকার। Platform cost ধরলে এক জোড়া card আর ছোট workstation build থাকে না।

একটি 32GB card

Reliability, warranty এবং simple deployment memory-এর সর্বনিম্ন দামের চেয়ে গুরুত্বপূর্ণ হলে একটি 32GB card বেছে নিন। R9700 এবং RTX 5090 এই পছন্দের দুই রূপ। AMD capacity এবং price-এ জোর দেয়। NVIDIA software breadth এবং mature CUDA support-এ জোর দেয়।

ব্যবহৃত V100 বা MI50

Driver testing, cooling work এবং backend maintenance project-এর অংশ হলে তবেই used data-center hardware বেছে নিন। Card price budget-এর প্রথম line, শেষ line নয়।

Apple silicon

Silence, low idle power এবং compact desktop maximum throughput-এর চেয়ে গুরুত্বপূর্ণ হলে 32GB Apple silicon system বেছে নিন। Full 32GB model-এর জন্য available ধরে নেওয়ার আগে নির্দিষ্ট runner-এর memory allocation দেখুন।

Cloud rental

Workload occasional হলে, model বারবার বদলালে অথবা local ownership-এর চেয়ে দ্রুত prompt response গুরুত্বপূর্ণ হলে rental বেছে নিন। Test-এর পর instance বন্ধ করুন। Idle time দ্রুত price advantage সরিয়ে দেয়।

আরও ভালো comparison worksheet

কেনার আগে প্রতিটি candidate-এর জন্য লিখুন:

  • Runtime overhead-এর পর ব্যবহারযোগ্য model memory।
  • Weight format এবং প্রত্যাশিত model size।
  • Target context length-এ KV-cache size।
  • Representative prompt-এর prefill speed।
  • Context পূর্ণ হওয়ার পর decode speed।
  • ফলাফলের জন্য দরকারি backend এবং driver version।
  • স্থানীয় electricity rate-এ idle এবং loaded power।
  • Host cost, cooling, adapter, storage এবং warranty।
  • আপনি যত ঘণ্টা ব্যবহার করবেন তার rental equivalent।

সবচেয়ে কার্যকর পরীক্ষা আপনার বাস্তব workload-এর prompt ব্যবহার করে। Coding-এর জন্য representative codebase নিন। Research-এর জন্য স্বাভাবিক retrieval বা paste workflow-সহ দীর্ঘ document নিন। First token পর্যন্ত সময়, prompt processing time, generation speed, memory use এবং output quality মাপুন।

চূড়ান্ত সুপারিশ

কম ঝামেলার 32GB CUDA build-এর জন্য দুটি RTX 5060 Ti 16GB কিনুন। ছোট test backend প্রত্যাশামতো কাজ নিশ্চিত করার পরেই tensor-split configuration ব্যবহার করুন।

পরিষ্কার workstation দরকার হলে একটি 32GB card কিনুন। আপনার নির্বাচিত runner-এর জন্য শক্তিশালী software path-সহ card নিন, কম dollars-per-gigabyte-সহ card নয়।

Maintenance project গ্রহণ করলে তবেই V100 বা MI50 ব্যবহার করুন। দুর্বল prefill-সহ সস্তা accelerator দীর্ঘ codebase prompt-এর জন্য bargain নয়।

ব্যবহার অনিয়মিত হলে 5090-class GPU ভাড়া নিন। বড় purchase-এর আগে rental test বাস্তব memory, speed এবং context data দেয়।

32GB-এর প্রশ্ন তাই “কোন card-এর gigabyte সবচেয়ে সস্তা?” নয়। প্রশ্ন হল “কোন system যথেষ্ট ব্যবহারযোগ্য memory রাখে, আমার workload দ্রুত পড়ে, আমার software-এর সঙ্গে কাজ করে এবং নিয়মিত ব্যবহারে purchase price আদায় করে?”

রেফারেন্স

পরবর্তী পদক্ষেপ

কেনার আগে representative prompt দিয়ে worksheet ব্যবহার করুন। First token পর্যন্ত সময়, prompt processing, decode speed, memory use, power এবং মোট platform cost তুলনা করুন। ছোট project হলে আগে ভাড়া নিন এবং measured result purchase decision-এর সঙ্গে রাখুন।