దాదాపు ప్రతి భాషా అభ్యాసకుడి ప్రయాణంలో ఏదో ఒక దశలో ఒకే ప్రశ్న ఎదురవుతుంది:

“నిజంగా సరళంగా మాట్లాడగలగాలంటే నేను ఎన్ని పదాలు తెలుసుకోవాలి?”

ఇది సహజమైన ప్రశ్న. ఒక భాషను నేర్చుకోవడం అంతులేని ప్రక్రియలా అనిపించవచ్చు; ఒక స్పష్టమైన సంఖ్య ఉంటే ఆ ప్రయాణం మరింత సులభంగా నిర్వహించగలిగినట్టుగా అనిపిస్తుంది. ఎవరైనా సులభంగా “ఖచ్చితంగా 5,000 పదాలు నేర్చుకోండి, మీరు సరళంగా మాట్లాడగలరు” అని చెప్పగలిగితే, భాష నేర్చుకోవడం చాలా తేలికగా కనిపిస్తుంది.

నిజాయితీగా చెప్పాలంటే, సమాధానం అంత సూటిగా ఉండదు.

కఠినమైన భాషాశాస్త్ర దృష్టికోణంలో, సరళత్వాన్ని ఒకే పదాల సంఖ్యకు కుదించలేం. భాష అనేది మూసివేసిన డేటాబేస్ కాదు. అది ధ్వనులు, అర్థాలు, వ్యాకరణం, సామాజిక అలవాట్లు, సాంస్కృతిక సూచనలు, మరియు వాడుకలో మారే సౌకర్యవంతమైన నమూనాలతో కూడిన జీవ వ్యవస్థ.

అయినా, నిజమైన భాషా వాడుకకు చెందిన పెద్ద సేకరణలను అధ్యయనం చేసే కార్పస్ లింగ్విస్టిక్స్ — మనకు చాలా ఉపయోగకరమైన ప్రమాణాలను ఇస్తుంది. Paul Nation గారు, Stuart Webb గారు మరియు ఇతర పరిశోధకులు, మాట్లాడే మరియు రాత ఇంగ్లీష్‌ను వేర్వేరు స్థాయిల్లో అర్థం చేసుకోవడానికి ఎంత పదజాలం అవసరమో అధ్యయనం చేశారు. వారి పరిశోధనలు మనకు ఏదో మాయా సంఖ్యను ఇవ్వవు, కానీ ఒక వాస్తవిక మార్గపటాన్ని మాత్రం ఇస్తాయి.

ఈ వ్యాసం ప్రధానంగా ఇంగ్లీష్‌పై దృష్టి పెడుతుంది, ఎందుకంటే పదాల వాడుక తరచుదనంపై అత్యంత విస్తృతంగా అధ్యయనం చేయబడిన డేటా ఇంగ్లీష్‌లో ఉంది. సాధారణ సూత్రాలు ఇతర భాషలకు కూడా ఉపయోగపడతాయి, కానీ వ్యాకరణం, పదరూప నిర్మాణం, లిపి, మరియు పరిశోధకులు పదజాలాన్ని ఎలా లెక్కిస్తారనే విషయాలపై ఆధారపడి ఖచ్చితమైన సంఖ్యలు మారవచ్చు.

ఆ మార్గపటాన్ని అర్థం చేసుకోవాలంటే, ముందుగా ఒక ముఖ్యమైన ప్రశ్నను స్పష్టంగా చేసుకోవాలి.

మనము నిజంగా దేనిని లెక్కిస్తున్నాం?

“నేను ఎన్ని పదాలు తెలుసుకోవాలి?” అని అడిగినప్పుడు “పదం” అనే మాట సులభంగా అనిపిస్తుంది. కానీ భాషాశాస్త్రంలో అది అసలు సులభం కాదు.

ఇంగ్లీష్ క్రియ run ను తీసుకోండి.

మీరు దాన్ని అనేక రూపాల్లో చూడవచ్చు: run, runs, ran, running

వీటిని నాలుగు వేర్వేరు పదాలుగా లెక్కించాలా? లేక వేర్వేరు రూపాలు ఉన్న ఒకే పదంగా చూడాలా?

చాలా మంది అభ్యాసకులు, తమకు run అనే క్రియ తెలుసంటే, దాని ప్రతి వ్యాకరణ రూపాన్ని పూర్తిగా కొత్త పదంగా లెక్కించకూడదనుకుంటారు. అందుకే భాషావేత్తలు పదజాల పరిమాణాన్ని కొలిచేటప్పుడు తరచుగా కొంచెం సారాంశాత్మకమైన యూనిట్లను ఉపయోగిస్తారు.

మొదటి ఉపయోగకరమైన భావన లెమా.

లెమా అంటే ఒక పదం యొక్క మూల రూపం లేదా నిఘంటువు రూపం. ఉదాహరణకు, go అనేది go, goes, went, gone, going అన్న రూపాల వెనుక ఉన్న లెమా. నిఘంటువులో మీరు సాధారణంగా ప్రతి సాధ్యమైన వ్యాకరణ రూపాన్ని వేరుగా కాకుండా మూల రూపాన్నే వెతుకుతారు. కార్పస్ సాధనాలు కూడా లెమాలను ఇలాంటి విధంగానే ఉపయోగిస్తాయి: అవి వేర్వేరు పదరూపాలను ఒక కేంద్ర ఎంట్రీ కింద గుంపుగా ఉంచుతాయి.

ఇంతవరకు ఇది చాలావరకు సహజంగానే అనిపిస్తుంది.

కానీ అనేక పదజాల అధ్యయనాలు — ముఖ్యంగా ఇంగ్లీష్‌లో — ఇంకా విస్తృతమైన భావనను ఉపయోగిస్తాయి: పద కుటుంబం.

పద కుటుంబం అంటే ఏమిటి?

పద కుటుంబం అంటే ఒకే మూల పదం చుట్టూ నిర్మితమయ్యే సంబంధిత పదాల సమూహం. అందులో ప్రధాన పదం, అలాగే దాని సాధారణంగా కనిపించే, సులభంగా అర్థమయ్యే కొన్ని రూపాలు ఉంటాయి.

ఉదాహరణకు, teach చుట్టూ ఉన్న సరళీకృత పద కుటుంబం ఇలా ఉండవచ్చు: teach, teaches, teaching, taught, teacher

nation చుట్టూ ఉన్న సరళీకృత పద కుటుంబం ఇలా ఉండవచ్చు: nation, national, international, nationality

ఇక్కడ భావం ఈ పదాలన్నీ ఒకటేనని కాదు. నిజమైన వాడుకలో అవి స్పష్టంగా వేర్వేరు పదాలే. కానీ ఒక పదం తెలిసినప్పుడు మరొకదాన్ని అర్థం చేసుకోవడంలో సహాయపడేంత సంబంధం వాటి మధ్య ఉంటుంది.

ఇది ముఖ్యమైన విషయం, ఎందుకంటే భాషా అభ్యాసకులు ప్రతి పదాన్ని పూర్తిగా ఒంటరిగా నేర్చుకోరు. మీకు happy తెలిసిన తర్వాత, unhappy లేదా happiness అర్థం చేసుకోవడం సులభమవుతుంది. మీకు move తెలిసిన తర్వాత, movement అర్థం ఊహించడం సులభమవుతుంది. మీకు use తెలిసిన తర్వాత, useful, useless, మరియు reuse వంటి పదాలను గుర్తించడం సులభమవుతుంది.

పద కుటుంబాల వెనుక ఉన్న తర్కం ఇదే.

అయితే, పద కుటుంబాలు ఎప్పుడూ సులభం కావు. కొన్ని సంబంధిత పదాలను మూల పదం నుంచి సులభంగా అర్థం చేసుకోవచ్చు, కానీ మరికొన్ని అలా ఉండవు. ఉదాహరణకు, sign మరియు signature సంబంధిత పదాలే, కానీ ఆ సంబంధం ప్రారంభ స్థాయి అభ్యాసకుడికి స్పష్టంగా కనిపించకపోవచ్చు. Compete, competition, మరియు competitive సంబంధిత పదాలే, కానీ అవి వాక్యాల్లో వేర్వేరు విధంగా ప్రవర్తిస్తాయి.

అందుకే పద కుటుంబాల ఆధారంగా లెక్కించడం పరిశోధనకు ఉపయోగకరం, కానీ అభ్యాసకులకు కొన్నిసార్లు గందరగోళంగా ఉండవచ్చు. ఇది పదజాల జ్ఞానానికి ఒక ప్రాయోగిక అంచనాను ఇస్తుంది, కానీ ఆ కుటుంబంలోని ప్రతి పదాన్ని ఆటోమేటిక్‌గా పూర్తిగా నేర్చుకున్నట్టే అని కాదు.

ఈ వ్యాసంలో, పదజాల పరిమాణం గురించి మాట్లాడేటప్పుడు ప్రధాన పదజాల యూనిట్లు అనే దృక్కోణంలో ఆలోచించడం మంచిది: ప్రతి వేర్వేరు పదరూపం కాదు, అలాగే ఎప్పుడూ కఠినమైన ఒకే నిఘంటువు లెమా కూడా కాదు. అనేక ఇంగ్లీష్ పదజాల అధ్యయనాల్లో, ప్రమాణ సంఖ్యలు పద కుటుంబాల ఆధారంగా ఉంటాయి.

ఆ తేడా చాలా ముఖ్యమైనది.

3,000 పద కుటుంబాలు తెలిసిన అభ్యాసకుడు నిజమైన పాఠ్యాలలో 3,000 కంటే ఎంతో ఎక్కువ వ్యక్తిగత పదరూపాలను గుర్తించగలరు. కానీ దీని అర్థం, వారు వాటన్నింటినీ మాట్లాడేటప్పుడు లేదా రాస్తేటప్పుడు చురుకుగా ఉపయోగించగలరని కాదు.

వాడుక తరచుదనం ఎందుకు అంత ముఖ్యమైనది?

భాషలు ప్రతి పదం సమానంగా కనిపించే సమతుల్య వ్యవస్థలు కావు.

చాలా సాధారణమైన కొద్ది సంఖ్యలోని పదాలు నిరంతరం కనిపిస్తాయి. వేలాది ఇతర పదాలు మాత్రం అప్పుడప్పుడు మాత్రమే కనిపిస్తాయి. ఈ నమూనా తరచుగా Zipf’s law తో సంబంధం కలిగి ఉంటుంది; ఇది ఒక గణాంక ధోరణి, ఇందులో అత్యంత తరచుగా ఉపయోగించే పదాలు నిజమైన భాషా వాడుకలో చాలా పెద్ద భాగాన్ని ఆక్రమిస్తాయి.

ఇంగ్లీష్‌లో the, be, have, do, say, go, make, know, think, good వంటి పదాలు ఎక్కడ చూసినా కనిపిస్తాయి. అరుదైన పదాలు నిర్దిష్ట రంగాల్లో ఉపయోగకరంగా, అందంగా, లేదా ముఖ్యంగా ఉండవచ్చు, కానీ రోజువారీ సంభాషణలో అవి అంత తరచుగా కనిపించవు.

దీని వల్ల ఒక శక్తివంతమైన అభ్యాస సూత్రం ఏర్పడుతుంది:

మొదటి కొన్ని వేల అధిక-తరచుదన పదాలు మీకు అత్యధిక ఫలితాన్ని ఇస్తాయి.

అత్యంత సాధారణమైన 1,000 పదాలను నేర్చుకోవడం సాధారణ భాషలో ఆశ్చర్యకరంగా పెద్ద భాగాన్ని గుర్తించడంలో మీకు సహాయపడుతుంది. కానీ దీని అర్థం మీరు అన్నీ అర్థం చేసుకుంటారని కాదు. మిగిలిన తెలియని పదాలే తరచుగా వాక్యంలోని ముఖ్యమైన అర్థాన్ని మోసుకెళ్తాయి.

ఉదాహరణకు:

I went to the ___ because my ___ was hurting.

మీరు వ్యాకరణం మరియు సాధారణ పదాలలో ఎక్కువ భాగాన్ని అర్థం చేసుకోవచ్చు, కానీ ఖాళీ స్థానాల్లో ఉండే పదాలు అత్యంత ముఖ్యమైనవిగా ఉండవచ్చు. అది doctor అయి ఉండొచ్చా? Dentist? Pharmacy? Hospital? Knee? Stomach? Tooth?

అందుకే కవరేజ్ ముఖ్యం.

“95% కవరేజ్” అంటే ఏమిటి?

కార్పస్ పరిశోధకులు తరచుగా పాఠ్య కవరేజ్ గురించి మాట్లాడుతారు. అంటే ఒక పాఠ్యంలో ఉన్న పదాలలో మీకు ఇప్పటికే తెలిసిన పదాల శాతం.

ఒక పాఠ్యంలో 95% పదాలు మీకు తెలిసి ఉంటే, అది అద్భుతంగా అనిపిస్తుంది. కానీ ఇప్పటికీ ప్రతి 20 పదాల్లో 1 పదం తెలియకపోవచ్చు అన్న మాట.

చిన్న వాక్యంలో అది పెద్ద సమస్య కాకపోవచ్చు. కానీ నవల, పోడ్‌కాస్ట్, సినిమా, లేదా ఉపన్యాసంలో అది అలసట కలిగించవచ్చు. తెలియని పదాలు మళ్లీ మళ్లీ వస్తాయి, వాటిలో కొన్ని అర్థానికి కీలకమైనవిగా ఉండవచ్చు.

సుమారు 95% కవరేజ్ వద్ద, ముఖ్యంగా విషయం మీకు పరిచయం ఉంటే మరియు దృశ్య లేదా పరిస్థితి ఆధారిత సహాయం ఉంటే, మీరు సాధారణ ఆలోచనను అనుసరించగలరు. సుమారు 98% కవరేజ్ వద్ద, అర్థం చేసుకోవడం మరింత సౌకర్యంగా మారుతుంది. మీరు సందర్భం నుంచి ఎక్కువ ఊహించగలరు, తక్కువ అంతరాయంతో చదవగలరు లేదా వినగలరు, ప్రతి వాక్యాన్ని డీకోడ్ చేయడంపై కాకుండా అర్థంపై ఎక్కువ దృష్టి పెట్టగలరు.

Paul Nation గారి విస్తృతంగా ఉదహరించబడే పని ప్రకారం, మాట్లాడే ఇంగ్లీష్‌లో సుమారు 98% కవరేజ్‌కు దాదాపు 6,000–7,000 పద కుటుంబాలు అవసరమవవచ్చు, అలాగే అనేక రాత పాఠ్యాలకు 8,000–9,000 పద కుటుంబాలు అవసరమవవచ్చు.

అనౌపచారిక మాట్లాడే ఇంగ్లీష్, సినిమాలు, మరియు టెలివిజన్ విషయంలో సంఖ్యలు కొంత తక్కువగా ఉండవచ్చు. Webb గారు మరియు Rodgers గారు కనుగొన్నదేమిటంటే, అత్యంత తరచుగా ఉపయోగించే 3,000 పద కుటుంబాలు, proper nouns మరియు marginal words‌తో కలిసి, టెలివిజన్ కార్యక్రమాల్లో సుమారు 95% కవరేజ్ ఇచ్చాయి; సుమారు 7,000 పద కుటుంబాలు సుమారు 98% కవరేజ్ ఇచ్చాయి.

అనౌపచారిక మాట్లాడే ఇంగ్లీష్‌పై జరిగిన మరింత తాజా అధ్యయనం కూడా, కొన్ని రకాల అనౌపచారిక మాట్లాడే ఇన్‌పుట్‌కు సుమారు 2,000–3,000 పద కుటుంబాలు దాదాపు 95% కవరేజ్ ఇవ్వవచ్చని, అలాగే జానర్‌పై ఆధారపడి సుమారు 98% కోసం 5,000–7,000 అవసరమవవచ్చని సూచిస్తుంది.

కాబట్టి సమాధానం మీరు ఏమి అర్థం చేసుకోవాలనుకుంటున్నారనే దానిపై ఆధారపడి ఉంటుంది.

సాధారణ సంభాషణ, సిట్‌కామ్, విశ్వవిద్యాలయ ఉపన్యాసం, న్యాయ పత్రం, మరియు సాహిత్య నవలకు ఖచ్చితంగా ఒకే పదజాలం అవసరం కాదు.

ప్రాయోగిక పదజాల ప్రమాణాలు

క్రింది పట్టిక కఠినమైన శాస్త్రీయ స్థాయి కాదు. ఇది కార్పస్ పరిశోధన మరియు పదజాల కవరేజ్ అధ్యయనాల ఆధారంగా రూపొందించిన, అభ్యాసకులకు సులభంగా ఉపయోగపడే ప్రాయోగిక మార్గదర్శి.

పదజాల పరిమాణం ప్రాయోగిక స్థాయి దాని సాధారణ అర్థం
800–1,000 ప్రధాన పదాలు బతుకుదెరువు స్థాయి / ప్రాథమిక సంభాషణ మీరు చాలా సాధారణమైన రోజువారీ పరిస్థితులను ఎదుర్కోగలరు, కానీ మీ భావవ్యక్తీకరణ పరిమితంగా ఉంటుంది మరియు అనేక వివరాలు మిస్ అవుతాయి.
2,000–3,000 పద కుటుంబాలు ప్రారంభ స్వతంత్రత సందర్భం, పునరావృతం, మరియు పరిచయమైన విషయాలు ఉంటే, అనౌపచారిక రోజువారీ భాషలో పెద్ద భాగాన్ని మీరు అర్థం చేసుకోగలరు.
3,000–5,000 పద కుటుంబాలు రోజువారీ సంభాషణలో ఆత్మవిశ్వాసం రోజువారీ జీవితం, ప్రయాణం, సరళమైన పని పరిస్థితులు, మరియు సాధారణ మీడియాల్లో స్వతంత్రంగా సంభాషించాలనుకునే అనేక మంది అభ్యాసకులకు ఇది వాస్తవికమైన ప్రారంభ స్థాయి.
6,000–9,000 పద కుటుంబాలు ఉన్నత స్థాయి అవగాహన అనేక సినిమాలు, పోడ్‌కాస్ట్‌లు, వ్యాసాలు, మరియు వృత్తిపరమైన సంభాషణలతో పాటు, మరింత వైవిధ్యమైన మాట్లాడే మరియు రాత ఇన్‌పుట్‌ను మీరు అర్థం చేసుకోగలరు.
10,000+ పద కుటుంబాలు / విస్తృతమైన స్వీకరణ పదజాలం మాతృభాష స్థాయికి దగ్గరగా లేదా అత్యంత ఉన్నత పరిధి క్లిష్టమైన, అకాడెమిక్, సాహిత్య, మరియు ప్రత్యేక రంగాల భాషను మీరు మరింత సౌకర్యంగా ఎదుర్కోగలరు, అయినప్పటికీ కొత్త పదాలు ఎప్పుడూ ఉంటూనే ఉంటాయి.

అత్యంత ముఖ్యమైన పాఠం ఇదే:

ఒక భాషను బాగా ఉపయోగించడానికి ఆ భాషలోని ప్రతి పదం మీకు తెలియాల్సిన అవసరం లేదు.

నిజానికి, ఏ భాషలోనైనా ప్రతి పదం తెలిసిన వ్యక్తి ఎవరూ ఉండరు. మాతృభాష మాట్లాడేవారు కూడా ప్రత్యేక రంగాలు, సాహిత్యం, చట్టం, వైద్యం, సాంకేతికత, లేదా ప్రాంతీయ మాట్లాడుకలో తెలియని పదాలను తరచుగా ఎదుర్కొంటారు.

మాతృభాష మాట్లాడేవారికి చురుకైన పదజాలం కంటే చాలా పెద్ద స్వీకరణ పదజాలం కూడా ఉంటుంది. స్వీకరణ పదజాలం అంటే మీరు గుర్తించి అర్థం చేసుకోగల పదాలు. చురుకైన పదజాలం అంటే మీరు మాట్లాడేటప్పుడు లేదా రాస్తేటప్పుడు ఆత్మవిశ్వాసంతో ఉపయోగించగల పదాలు. మాతృభాషగా ఇంగ్లీష్ మాట్లాడేవారి పదజాల పరిమాణంపై జరిగిన పరిశోధనలు చూపిస్తున్నదేమిటంటే, వయోజన మాతృభాష మాట్లాడేవారు పదివేల లెమాలను గుర్తించగలరు, కానీ రోజువారీ జీవితంలో వారు వాటిలో చాలా చిన్న భాగాన్నే చురుకుగా ఉపయోగిస్తారు.

భాషా అభ్యాసకులకు ఈ తేడా చాలా ముఖ్యమైనది.

సరళంగా మాట్లాడటానికి మీరు 20,000 పదాలను చురుకుగా ఉపయోగించాల్సిన అవసరం లేదు. కానీ మీ స్వీకరణ పదజాలం పెరిగేకొద్దీ, మీరు మరిన్ని పుస్తకాలు, సినిమాలు, సంభాషణలు, జోకులు, వాదనలు, మరియు సాంస్కృతిక సూచనలను అర్థం చేసుకోగలరు.

తర్వాతి భాగానికి సిద్ధంగా ఉన్నారా? భాగం 2ను ఇక్కడ చూడండి: