প্রায় প্রতিটি ভাষা শিক্ষার্থীর যাত্রায় কোনো না কোনো সময় একই প্রশ্নটি আসে:

“সাবলীল হতে আসলে আমার কত শব্দ জানা দরকার?”

এটি খুব স্বাভাবিক প্রশ্ন। একটি ভাষা শেখা অনেক সময় অন্তহীন মনে হতে পারে, আর একটি স্পষ্ট সংখ্যা জানলে পুরো প্রক্রিয়াটি আরও সামলানো সহজ বলে মনে হয়। যদি কেউ সহজভাবে বলতে পারত, “ঠিক ৫,০০০টি শব্দ শিখুন, তাহলেই আপনি সাবলীল হবেন,” তাহলে ভাষা শেখা অনেক সহজ দেখাত।

সত্যিকারের উত্তরটি আরও সূক্ষ্ম।

কঠোর ভাষাবৈজ্ঞানিক দৃষ্টিকোণ থেকে দেখলে, সাবলীলতাকে একটি মাত্র শব্দসংখ্যায় নামিয়ে আনা যায় না। ভাষা কোনো বন্ধ ডেটাবেস নয়। এটি ধ্বনি, অর্থ, ব্যাকরণ, সামাজিক অভ্যাস, সাংস্কৃতিক উল্লেখ এবং ব্যবহারের নমনীয় ধাঁচের একটি জীবন্ত ব্যবস্থা।

তবুও, করপাস ভাষাবিজ্ঞান — অর্থাৎ বাস্তব ভাষা ব্যবহারের বড় বড় সংগ্রহের অধ্যয়ন — আমাদের খুবই উপকারী মানদণ্ড দেয়। Paul Nation, Stuart Webb এবং আরও অনেকে বিভিন্ন স্তরে কথ্য ও লিখিত ইংরেজি বুঝতে কত শব্দভান্ডার দরকার, তা নিয়ে গবেষণা করেছেন। তাঁদের গবেষণা আমাদের কোনো জাদুকরী সংখ্যা দেয় না, তবে একটি বাস্তবসম্মত মানচিত্র দেয়।

এই লেখাটি মূলত ইংরেজির ওপর কেন্দ্রীভূত, কারণ ইংরেজিতে শব্দ ব্যবহারের ঘনত্ব নিয়ে সবচেয়ে বেশি গবেষণা হয়েছে। সাধারণ নীতিগুলো অন্যান্য ভাষার ক্ষেত্রেও উপকারী, তবে ব্যাকরণ, শব্দগঠন, লেখনপদ্ধতি এবং গবেষকেরা কীভাবে শব্দ গণনা করেন—এসবের ওপর নির্ভর করে সঠিক সংখ্যাগুলো বদলাতে পারে।

এই মানচিত্রটি বুঝতে হলে আগে আমাদের একটি গুরুত্বপূর্ণ প্রশ্ন পরিষ্কার করতে হবে।

আমরা আসলে কী গণনা করছি?

মানুষ যখন জিজ্ঞেস করে, “আমার কত শব্দ জানা দরকার?”, তখন “শব্দ” কথাটি খুব সহজ মনে হয়। কিন্তু ভাষাবিজ্ঞানে এটি মোটেও সহজ নয়।

ইংরেজি ক্রিয়া run ধরুন।

আপনি এটিকে নানা রূপে দেখতে পারেন: run, runs, ran, running

আমরা কি এগুলোকে চারটি আলাদা শব্দ হিসেবে গণনা করব? নাকি ভিন্ন ভিন্ন রূপসহ একটি শব্দ হিসেবে?

বেশিরভাগ শিক্ষার্থী সম্ভবত মনে করবেন, তাঁরা যদি run ক্রিয়াটি জানেন, তাহলে প্রতিটি ব্যাকরণগত রূপকে একেবারে নতুন শব্দ হিসেবে গণনা করা হোক—এটা তাঁরা চান না। এ কারণেই ভাষাবিজ্ঞানীরা শব্দভান্ডারের আকার মাপার সময় প্রায়ই আরও বিমূর্ত একক ব্যবহার করেন।

প্রথম উপকারী ধারণাটি হলো lemma বা লেমা।

একটি lemma হলো কোনো শব্দের মূল বা অভিধানগত রূপ। উদাহরণস্বরূপ, go হলো go, goes, went, gone, going-এর পেছনের লেমা। অভিধানে সাধারণত আপনি মূল রূপটি খোঁজেন, প্রতিটি সম্ভাব্য ব্যাকরণগত রূপ আলাদা করে নয়। করপাস টুলগুলোও একইভাবে লেমা ব্যবহার করে: তারা ভিন্ন ভিন্ন শব্দরূপকে একটি কেন্দ্রীয় এন্ট্রির অধীনে একত্র করে।

এ পর্যন্ত বিষয়টি বেশ স্বাভাবিকভাবেই বোঝা যায়।

কিন্তু অনেক শব্দভান্ডার গবেষণায় — বিশেষ করে ইংরেজিতে — আরও বিস্তৃত একটি ধারণা ব্যবহার করা হয়: word family বা শব্দ-পরিবার।

শব্দ-পরিবার কী?

একটি word family বা শব্দ-পরিবার হলো একই মূল শব্দকে ঘিরে তৈরি সম্পর্কিত শব্দের একটি দল। এতে মূল শব্দ এবং তার কিছু সাধারণ, সহজে বোঝা যায় এমন রূপ অন্তর্ভুক্ত থাকে।

উদাহরণস্বরূপ, teach শব্দকে কেন্দ্র করে একটি সরলীকৃত শব্দ-পরিবারে থাকতে পারে: teach, teaches, teaching, taught, teacher

nation শব্দকে কেন্দ্র করে একটি সরলীকৃত শব্দ-পরিবারে থাকতে পারে: nation, national, international, nationality

এর মানে এই নয় যে এসব শব্দ একেবারে একই। বাস্তব ব্যবহারে এগুলো স্পষ্টভাবেই আলাদা শব্দ। তবে এগুলো এতটাই সম্পর্কিত যে একটি জানলে অনেক সময় অন্যগুলো বুঝতে সাহায্য করে।

এটি গুরুত্বপূর্ণ, কারণ ভাষা শিক্ষার্থীরা প্রতিটি শব্দ আলাদা আলাদা করে শেখেন না। আপনি একবার happy জানলে unhappy বা happiness বোঝা সহজ হয়। আপনি একবার move জানলে movement-এর অর্থ অনুমান করা সহজ হয়। আপনি একবার use জানলে useful, useless এবং reuse-এর মতো শব্দ চিনতে সহজ হয়।

শব্দ-পরিবারের পেছনের যুক্তি এটাই।

তবে শব্দ-পরিবার সব সময় সহজ নয়। কিছু সম্পর্কিত শব্দ মূল শব্দ থেকে সহজে বোঝা যায়, আবার কিছু যায় না। যেমন, sign এবং signature সম্পর্কিত, কিন্তু একজন নতুন শিক্ষার্থীর কাছে সম্পর্কটি স্পষ্ট নাও হতে পারে। Compete, competition এবং competitive সম্পর্কিত, কিন্তু বাক্যে এদের ব্যবহার আলাদা।

এ কারণেই গবেষণার জন্য শব্দ-পরিবার ধরে গণনা করা উপকারী, কিন্তু শিক্ষার্থীদের জন্য কখনও কখনও বিভ্রান্তিকর হতে পারে। এটি শব্দভান্ডারের জ্ঞানের একটি ব্যবহারিক অনুমান দেয়, কিন্তু এর মানে এই নয় যে একই পরিবারের প্রতিটি শব্দ স্বয়ংক্রিয়ভাবে আয়ত্ত হয়ে গেছে।

এই লেখায় আমরা যখন শব্দভান্ডারের আকার নিয়ে কথা বলি, তখন মূল শব্দভান্ডার একক হিসেবে ভাবাই ভালো: প্রতিটি আলাদা শব্দরূপ নয়, আবার সব সময় একটি কঠোর অভিধানগত লেমাও নয়। ইংরেজি শব্দভান্ডার নিয়ে অনেক গবেষণায় মানদণ্ডের সংখ্যাগুলো word families বা শব্দ-পরিবারের ওপর ভিত্তি করে তৈরি।

এই পার্থক্যটি গুরুত্বপূর্ণ।

যে শিক্ষার্থী ৩,০০০টি শব্দ-পরিবার জানেন, তিনি বাস্তব লেখায় ৩,০০০টির চেয়েও অনেক বেশি পৃথক শব্দরূপ চিনতে পারেন। কিন্তু এর মানে এই নয় যে তিনি সেগুলো সব কথা বলা বা লেখায় সক্রিয়ভাবে ব্যবহার করতে পারেন।

ব্যবহারের ঘনত্ব এত গুরুত্বপূর্ণ কেন

ভাষা এমন কোনো ভারসাম্যপূর্ণ ব্যবস্থা নয় যেখানে প্রতিটি শব্দ সমান ঘন ঘন দেখা যায়।

খুব সাধারণ অল্প কিছু শব্দ বারবার দেখা যায়। আরও হাজার হাজার শব্দ কেবল মাঝে মাঝে দেখা যায়। এই ধাঁচটি প্রায়ই Zipf’s law-এর সঙ্গে সম্পর্কিত, যা একটি পরিসংখ্যানগত প্রবণতা—যেখানে সবচেয়ে বেশি ব্যবহৃত শব্দগুলো বাস্তব ভাষা ব্যবহারের খুব বড় অংশ জুড়ে থাকে।

ইংরেজিতে the, be, have, do, say, go, make, know, think, good-এর মতো শব্দ সর্বত্র দেখা যায়। বিরল শব্দগুলো নির্দিষ্ট ক্ষেত্রে উপকারী, সুন্দর বা গুরুত্বপূর্ণ হতে পারে, কিন্তু দৈনন্দিন যোগাযোগে সেগুলো প্রায় এত ঘন ঘন আসে না।

এতে একটি শক্তিশালী শেখার নীতি তৈরি হয়:

প্রথম কয়েক হাজার উচ্চ-ঘনত্বের শব্দ আপনাকে সবচেয়ে বেশি ফল দেয়।

সবচেয়ে সাধারণ ১,০০০টি শব্দ শেখা আপনাকে সাধারণ ভাষার আশ্চর্যজনক বড় অংশ চিনতে সাহায্য করতে পারে। কিন্তু এর মানে এই নয় যে আপনি সবকিছু বুঝবেন। বাকি অজানা শব্দগুলোই অনেক সময় বাক্যের গুরুত্বপূর্ণ অর্থ বহন করে।

উদাহরণস্বরূপ:

I went to the ___ because my ___ was hurting.

আপনি ব্যাকরণ এবং সাধারণ শব্দের বেশিরভাগই বুঝতে পারেন, কিন্তু ফাঁকা শব্দগুলো খুব গুরুত্বপূর্ণ হতে পারে। সেটি কি doctor? Dentist? Pharmacy? Hospital? Knee? Stomach? Tooth?

এ কারণেই coverage বা পাঠ-বোঝার পরিসর গুরুত্বপূর্ণ।

“৯৫% coverage” বলতে কী বোঝায়?

করপাস গবেষকেরা প্রায়ই text coverage বা টেক্সট কভারেজ নিয়ে কথা বলেন। এর অর্থ হলো কোনো লেখার কত শতাংশ শব্দ আপনি আগে থেকেই জানেন।

আপনি যদি কোনো লেখার ৯৫% শব্দ জানেন, শুনতে দারুণ লাগে। কিন্তু তবুও এর মানে হলো প্রতি ২০টি শব্দে ১টি শব্দ অজানা থাকতে পারে।

ছোট বাক্যে এটি বড় সমস্যা নাও হতে পারে। কিন্তু উপন্যাস, পডকাস্ট, চলচ্চিত্র বা বক্তৃতায় এটি ক্লান্তিকর হয়ে উঠতে পারে। অজানা শব্দ বারবার আসে, এবং কিছু শব্দ অর্থ বোঝার জন্য অত্যন্ত গুরুত্বপূর্ণ হতে পারে।

প্রায় ৯৫% coverage-এ আপনি সাধারণ ধারণা অনুসরণ করতে পারেন, বিশেষ করে বিষয়টি পরিচিত হলে এবং দৃশ্যমান বা পরিস্থিতিগত সহায়তা থাকলে। প্রায় ৯৮% coverage-এ বোঝা অনেক বেশি স্বচ্ছন্দ হয়ে ওঠে। আপনি প্রসঙ্গ থেকে আরও বেশি অনুমান করতে পারেন, কম বাধা নিয়ে পড়তে বা শুনতে পারেন, এবং প্রতিটি বাক্য ডিকোড করার বদলে অর্থের ওপর বেশি মনোযোগ দিতে পারেন।

Paul Nation-এর বহুল উদ্ধৃত কাজ অনুযায়ী, কথ্য ইংরেজির প্রায় ৯৮% কভারেজ পেতে আনুমানিক ৬,০০০–৭,০০০ word families দরকার হতে পারে, আর অনেক লিখিত পাঠের জন্য ৮,০০০–৯,০০০ word families দরকার হতে পারে।

অনানুষ্ঠানিক কথ্য ইংরেজি, সিনেমা এবং টেলিভিশনের ক্ষেত্রে সংখ্যাগুলো কিছুটা কম হতে পারে। Webb এবং Rodgers দেখেছেন, সবচেয়ে বেশি ব্যবহৃত ৩,০০০ word families, নিজস্ব নাম এবং প্রান্তিক শব্দের সঙ্গে মিলে টেলিভিশন অনুষ্ঠানের প্রায় ৯৫% coverage দেয়, আর প্রায় ৭,০০০ word families প্রায় ৯৮% coverage দেয়।

অনানুষ্ঠানিক কথ্য ইংরেজি নিয়ে আরও সাম্প্রতিক একটি গবেষণাও ইঙ্গিত করে যে কিছু ধরনের অনানুষ্ঠানিক কথ্য ইনপুটে প্রায় ২,০০০–৩,০০০ word families প্রায় ৯৫% কভারেজ দিতে পারে, আর ঘরানার ওপর নির্ভর করে প্রায় ৯৮% কভারেজের জন্য ৫,০০০–৭,০০০ দরকার হতে পারে।

তাই উত্তরটি নির্ভর করে আপনি কী বুঝতে চান তার ওপর।

একটি সাধারণ আলাপ, একটি সিটকম, একটি বিশ্ববিদ্যালয় বক্তৃতা, একটি আইনি নথি এবং একটি সাহিত্যিক উপন্যাস—এসবের জন্য ঠিক একই শব্দভান্ডার লাগে না।

ব্যবহারিক শব্দভান্ডারের মানদণ্ড

নিচের সারণিটি কোনো কঠোর বৈজ্ঞানিক স্কেল নয়। এটি করপাস গবেষণা এবং শব্দভান্ডার কভারেজ গবেষণার ওপর ভিত্তি করে শিক্ষার্থীবান্ধব একটি ব্যবহারিক নির্দেশিকা।

শব্দভান্ডারের আকার ব্যবহারিক স্তর সাধারণত এর অর্থ কী
৮০০–১,০০০ মূল শব্দ টিকে থাকার মতো / প্রাথমিক যোগাযোগ আপনি খুব সাধারণ দৈনন্দিন পরিস্থিতি সামলাতে পারবেন, কিন্তু প্রকাশভঙ্গি সীমিত থাকবে এবং অনেক বিস্তারিত তথ্য বাদ পড়বে।
২,০০০–৩,০০০ word families প্রাথমিক স্বনির্ভরতা আপনি অনানুষ্ঠানিক দৈনন্দিন ভাষার বড় অংশ বুঝতে পারবেন, বিশেষ করে প্রসঙ্গ, পুনরাবৃত্তি এবং পরিচিত বিষয় থাকলে।
৩,০০০–৫,০০০ word families আত্মবিশ্বাসী দৈনন্দিন যোগাযোগ দৈনন্দিন জীবন, ভ্রমণ, সহজ কাজের পরিস্থিতি এবং সাধারণ মিডিয়ায় স্বাধীনভাবে যোগাযোগ করতে চান—এমন অনেক শিক্ষার্থীর জন্য এটি একটি বাস্তবসম্মত সীমারেখা।
৬,০০০–৯,০০০ word families উন্নত বোধগম্যতা আপনি অনেক বেশি বৈচিত্র্যময় কথ্য ও লিখিত ইনপুট বুঝতে পারবেন, যার মধ্যে অনেক চলচ্চিত্র, পডকাস্ট, প্রবন্ধ এবং পেশাগত আলাপ অন্তর্ভুক্ত।
১০,০০০+ word families / বিস্তৃত গ্রহণমূলক শব্দভান্ডার মাতৃভাষীর কাছাকাছি বা অত্যন্ত উন্নত পরিসর আপনি জটিল, একাডেমিক, সাহিত্যিক এবং বিশেষায়িত ভাষা আরও স্বচ্ছন্দে সামলাতে পারবেন, যদিও নতুন শব্দ সব সময়ই থাকবে।

সবচেয়ে গুরুত্বপূর্ণ শিক্ষা হলো:

কোনো ভাষা ভালোভাবে ব্যবহার করতে সেই ভাষার প্রতিটি শব্দ জানার দরকার নেই।

আসলে, কোনো ভাষার সব শব্দ কেউ জানে না। মাতৃভাষীরাও নিয়মিত বিশেষায়িত ক্ষেত্র, সাহিত্য, আইন, চিকিৎসা, প্রযুক্তি বা আঞ্চলিক কথাবার্তায় অপরিচিত শব্দের মুখোমুখি হন।

মাতৃভাষীদের receptive vocabulary বা গ্রহণমূলক শব্দভান্ডারও তাঁদের active vocabulary বা সক্রিয় শব্দভান্ডারের চেয়ে অনেক বড়। গ্রহণমূলক শব্দভান্ডার মানে আপনি যে শব্দগুলো চিনতে ও বুঝতে পারেন। সক্রিয় শব্দভান্ডার মানে আপনি যে শব্দগুলো কথা বলা বা লেখায় আত্মবিশ্বাসের সঙ্গে ব্যবহার করতে পারেন। মাতৃভাষী ইংরেজিভাষীদের শব্দভান্ডারের আকার নিয়ে গবেষণায় দেখা যায়, প্রাপ্তবয়স্ক মাতৃভাষীরা দশ হাজারেরও বেশি লেমা চিনতে পারেন, কিন্তু দৈনন্দিন জীবনে সক্রিয়ভাবে ব্যবহার করেন তুলনামূলক অনেক ছোট একটি অংশ।

ভাষা শিক্ষার্থীদের জন্য এই পার্থক্যটি খুবই গুরুত্বপূর্ণ।

সাবলীলভাবে কথা বলতে আপনাকে ২০,০০০ শব্দ সক্রিয়ভাবে ব্যবহার করতে হবে না। কিন্তু আপনার গ্রহণমূলক শব্দভান্ডার যত বাড়বে, তত বেশি বই, চলচ্চিত্র, কথোপকথন, রসিকতা, তর্ক-বিতর্ক এবং সাংস্কৃতিক উল্লেখ আপনি বুঝতে পারবেন।

পরের অংশের জন্য প্রস্তুত? এখানে পর্ব ২ দেখুন: