پارامتر همبستگی چیست؟

ساخت وبلاگ

ضریب همبستگی r، قدرت و جهت رابطه خطی بین x و y را به ما می گوید. با این حال، قابلیت اطمینان مدل خطی به تعداد نقاط داده مشاهده شده در نمونه نیز بستگی دارد. ما باید هم مقدار ضریب همبستگی r و هم اندازه نمونه n را با هم بررسی کنیم.

ما یک آزمون فرضیه "معنی ضریب همبستگی" را انجام می دهیم تا تصمیم بگیریم که آیا رابطه خطی در داده های نمونه به اندازه کافی قوی است که بتوان از آن برای مدل کردن رابطه در جامعه استفاده کرد.

داده های نمونه برای محاسبه r، ضریب همبستگی برای نمونه استفاده می شود. اگر داده ای برای کل جمعیت داشتیم، می توانستیم ضریب همبستگی جمعیت را پیدا کنیم. اما چون فقط داده های نمونه داریم، نمی توانیم ضریب همبستگی جامعه را محاسبه کنیم. ضریب همبستگی نمونه، r، برآورد ما از ضریب همبستگی جمعیت ناشناخته است.

  • نماد ضریب همبستگی جمعیت ρ است، حرف یونانی "rho".
  • ρ = ضریب همبستگی جمعیت (ناشناخته)
  • r = ضریب همبستگی نمونه (مشخص، محاسبه شده از داده های نمونه)

آزمون فرضیه به ما امکان می دهد تصمیم بگیریم که آیا مقدار ضریب همبستگی جمعیت ρ "نزدیک به صفر" است یا "به طور قابل توجهی با صفر متفاوت است". ما این را بر اساس ضریب همبستگی نمونه r و حجم نمونه n تصمیم می گیریم.

اگر آزمون به این نتیجه برسد که ضریب همبستگی به طور قابل توجهی با صفر متفاوت است، می گوییم که ضریب همبستگی "معنی دار" است. نتیجه گیری: شواهد کافی برای نتیجه گیری وجود رابطه خطی معنادار بین x و y وجود دارد، زیرا ضریب همبستگی با صفر تفاوت معناداری دارد. نتیجه گیری به چه معناست: یک رابطه خطی معنادار بین x و y وجود دارد. ما می توانیم از خط رگرسیون برای مدل سازی رابطه خطی بین x و y در جامعه استفاده کنیم.

اگر آزمون به این نتیجه برسد که ضریب همبستگی تفاوت معنی داری با صفر ندارد (نزدیک به صفر است)، می گوییم که ضریب همبستگی «معنی دار» نیست.

نتیجه گیری: "شواهد کافی وجود ندارد که نتیجه بگیریم که بین x و y رابطه خطی قابل توجهی وجود دارد زیرا ضریب همبستگی تفاوت معنی داری با صفر ندارد."نتیجه گیری به این معنی است: رابطه خطی قابل توجهی بین x و y وجود ندارد. بنابراین ، ما نمی توانیم از خط رگرسیون برای الگوبرداری از رابطه خطی بین x و y در جمعیت استفاده کنیم.

توجه داشته باشید

  • اگر R قابل توجه باشد و طرح پراکندگی روند خطی را نشان می دهد ، می توان از این خط برای پیش بینی مقدار Y برای مقادیر X که در دامنه مقادیر X مشاهده شده است استفاده کرد.
  • اگر R قابل توجه نباشد یا اگر طرح پراکندگی روند خطی را نشان ندهد ، نباید از خط برای پیش بینی استفاده شود.
  • اگر R قابل توجه باشد و اگر طرح پراکندگی روند خطی را نشان دهد ، ممکن است خط برای پیش بینی خارج از دامنه مقادیر X مشاهده شده در داده ها مناسب یا قابل اعتماد نباشد.

انجام آزمون فرضیه

این فرضیه ها در کلمات چیست

  • فرضیه تهی h0: ضریب همبستگی جمعیت تفاوت معنی داری با صفر ندارد. در جمعیت رابطه خطی معنی داری (همبستگی) بین x و y وجود ندارد.
  • فرضیه جایگزین Ha: ضریب همبستگی جمعیت با صفر تفاوت معنی داری دارد. یک رابطه خطی قابل توجهی (همبستگی) بین x و y در جمعیت وجود دارد.

نتیجه گیری

دو روش تصمیم گیری وجود دارد. این دو روش معادل هستند و نتیجه مشابهی دارند.

  • روش 1: با استفاده از P-Value
  • روش 2: با استفاده از یک جدول از مقادیر بحرانی

در این فصل از این کتاب درسی ، ما همیشه از سطح معنی داری 5 ٪ ، α = 0. 05 استفاده خواهیم کرد

توجه داشته باشید

با استفاده از روش P-Value ، می توانید هر سطح اهمیت مناسب مورد نظر خود را انتخاب کنید. شما محدود به استفاده از α = 0. 05 نیستید. اما جدول مقادیر بحرانی ارائه شده در این کتاب درسی فرض می کند که ما از سطح معنی داری 5 ٪ ، α = 0. 05 استفاده می کنیم.(اگر می خواستیم با روش ارزش بحرانی از سطح اهمیت متفاوتی از 5 ٪ استفاده کنیم ، به جداول مختلفی از مقادیر بحرانی که در این کتاب درسی ارائه نشده است ، نیاز داریم.)

روش 1: استفاده از P-Value برای تصمیم گیری

برای محاسبه P-Value با استفاده از linregttest:

  • در صفحه ورودی linregttest ، در خط مستقیم برای β یا ρ ، "≠ 0" را برجسته کنید
  • صفحه خروجی مقدار p را در خطی که "p =" می خواند ، نشان می دهد.
  • (بیشتر نرم افزار آماری رایانه می تواند P-Value را محاسبه کند.)

اگر P-Value کمتر از سطح اهمیت باشد (05/0 = α)

  • تصمیم: فرضیه تهی را رد کنید.
  • نتیجه گیری: "شواهد کافی وجود دارد که نتیجه بگیریم که رابطه خطی قابل توجهی بین x و y وجود دارد زیرا ضریب همبستگی با صفر تفاوت معنی داری دارد."

اگر P-Value کمتر از سطح اهمیت نباشد (05/0 = α)

  • تصمیم: فرضیه تهی را رد نکنید.
  • نتیجه گیری: "شواهد کافی وجود ندارد که نتیجه بگیریم که بین x و y رابطه خطی قابل توجهی وجود دارد زیرا ضریب همبستگی تفاوت معنی داری با صفر ندارد."

یادداشت های محاسبه:

  • شما از فناوری برای محاسبه P-Value استفاده خواهید کرد. موارد زیر محاسبات را برای محاسبه آمار آزمون و P-Value شرح می دهد:
  • P-Value با استفاده از توزیع T با N-2 درجه آزادی محاسبه می شود.
  • The formula for the test statistic is [latex]displaystyle=fracsqrt>>>>-^<>>>>[/لاتکس]. مقدار آمار آزمون ، t ، در رایانه یا خروجی ماشین حساب به همراه P-Value نشان داده شده است. آمار آزمون T دارای همان علامت ضریب همبستگی r است.
  • P-Value منطقه ترکیبی در هر دو دم است.

یک روش جایگزین برای محاسبه P-Value (P) داده شده توسط LinregtTest ، فرمان 2*TCDF (ABS) ، 10^99 ، N-2) در 2 DISP است.

روش 2: استفاده از یک جدول از مقادیر مهم برای تصمیم گیری

مقادیر بحرانی 95 ٪ از جدول ضریب همبستگی نمونه می تواند مورد استفاده قرار گیرد تا ایده خوبی در مورد اینکه آیا مقدار محاسبه شده قابل توجه است یا خیر ، به شما می دهد. R را با مقدار بحرانی مناسب در جدول مقایسه کنید. اگر R بین مقادیر بحرانی مثبت و منفی نباشد ، ضریب همبستگی معنی دار است. اگر R قابل توجه است ، ممکن است بخواهید از خط برای پیش بینی استفاده کنید.

مثال

فرض کنید R = 0. 801 را با استفاده از N = 10 نقطه داده محاسبه کرده اید. df = n-2 = 1 0-2 = 8. مقادیر بحرانی مرتبط با df = 8-0. 632 و + 0. 632 هستند. اگر r positive critical value, then r is significant . Since r = 0.801 and 0.801>0. 632 ، R معنی دار است و ممکن است از خط برای پیش بینی استفاده شود. اگر این مثال را در یک خط شماره مشاهده کنید ، به شما کمک می کند.

r is not significant between -0.632 and +0.632. r = 0.801>+0. 632. بنابراین ، R قابل توجه است.

امتحانش کن

برای یک خط معین از بهترین تناسب ، شما محاسبه کرده اید که r = 0. 6501 با استفاده از نقاط داده n = 12 و مقدار بحرانی 0. 576 است. آیا می توان از خط برای پیش بینی استفاده کرد؟چرا و چرا نه؟

If the scatter plot looks linear then, yes, the line can be used for prediction, because r>ارزش بحرانی مثبت

مثال

فرض کنید R = -0. 624 را با 14 نقطه داده محاسبه کرده اید. df = 14 - 2 = 12. مقادیر بحران ی-0. 532 و 0. 532 است. ا ز-0. 624< 0.532, r is significant and the line can be used for prediction

r = -0. 624-0. 532. بنابراین ، R قابل توجه است.

امتحانش کن

برای یک خط معین از بهترین تناسب ، شما محاسبه می کنید که r = 0. 5204 با استفاده از نقاط داده n = 9 ، و مقدار بحرانی 0. 666 است. آیا می توان از خط برای پیش بینی استفاده کرد؟چرا و چرا نه؟

نه ، خط نمی تواند برای پیش بینی استفاده شود ، زیرا r

مثال 3

فرض کنید شما r = 0. 776 و n = 6. df = 6 - 2 = 4. مقادیر بحران ی-0. 811 و 0. 811 را محاسبه کرده اید. ا ز-0. 811<0.776 <0.811, r is not significant, and the line should not be used for prediction.

امتحانش کن

برای یک خط معین از بهترین تناسب ، شما با استفاده از نقاط داده N = 8 = 0. 7204 را محاسبه می کنید و مقدار بحرانی = 0. 707 است. آیا می توان از خط برای پیش بینی استفاده کرد؟چرا و چرا نه؟

بله ، خط می تواند برای پیش بینی استفاده شود ، زیرا r

مثال

فرض کنید ضرایب همبستگی زیر را محاسبه کرده اید. با استفاده از جدول در انتهای فصل ، تعیین کنید که آیا R قابل توجه است و از خط بهترین تناسب مرتبط با هر R می توان برای پیش بینی مقدار y استفاده کرد. اگر کمک می کند ، یک خط شماره بکشید.

  1. R = -0. 567 و اندازه نمونه ، n ، 19 است. DF = N - 2 = 17. مقدار بحران ی-0. 456 است. 0. 567< 0.456 so r is significant.
  2. r = 0.708 and the sample size, n , is nine. The df = n 2 = 7. The critical value is 0.666. 0.708>0. 666 بنابراین r قابل توجه است.
  3. R = 0. 134 و اندازه نمونه ، n ، 14 است. DF = 14 - 2 = 12. مقدار بحرانی 0. 532 است. 0. 134 بی ن-0. 532 و 0. 532 است بنابراین R معنی دار نیست.
  4. r = 0 و اندازه نمونه ، n ، پنج است. مهم نیست که DFS چیست ، R = 0 بین دو مقدار مهم است بنابراین R معنی دار نیست.

امتحانش کن

برای یک خط معین از بهترین تناسب ، شما با استفاده از نقاط داده N = 100 ، آن R = 0 را محاسبه می کنید. آیا می توان از خط برای پیش بینی استفاده کرد؟چرا و چرا نه؟

نه ، بدون توجه به اندازه نمونه ، از خط برای پیش بینی استفاده نمی شود.

فرضیات در آزمایش اهمیت ضریب همبستگی

آزمایش اهمیت ضریب همبستگی مستلزم آن است که فرضیات خاصی در مورد داده ها برآورده شود. فرض این آزمون این است که داده ها نمونه ای از نقاط مشاهده شده از جمعیت بزرگتر است. ما کل جمعیت را بررسی نکرده ایم زیرا انجام این کار امکان پذیر یا امکان پذیر نیست. ما در حال بررسی نمونه هستیم تا نتیجه گیری در مورد اینکه آیا رابطه خطی که بین x و y در داده های نمونه مشاهده می کنیم ، شواهد کافی قوی را ارائه می دهد تا نتیجه بگیریم که می توان نتیجه گرفت که رابطه خطی بین x و y در جمعیت وجود دارد.

معادله خط رگرسیون که از داده های نمونه محاسبه می کنیم بهترین خط مناسب برای نمونه خاص ما است. ما می خواهیم از این خط مناسب برای نمونه به عنوان تخمینی از بهترین خط برای جمعیت استفاده کنیم. بررسی پراکندگی و آزمایش اهمیت ضریب همبستگی به ما کمک می کند تا تعیین کنیم که آیا مناسب انجام این کار است یا خیر.

فرضیات اساسی آزمون اهمیت عبارتند از:

  • یک رابطه خطی در جامعه وجود دارد که مقدار متوسط y را برای مقادیر متغیر x مدل می کند. به عبارت دیگر، مقدار مورد انتظار y برای هر مقدار خاص روی یک خط مستقیم در جامعه قرار دارد.(ما معادله خط را برای جامعه نمی دانیم. خط رگرسیون ما از نمونه بهترین تخمین ما از این خط در جامعه است.)
  • مقادیر y برای هر مقدار x خاص معمولاً در مورد خط توزیع می شود. این نشان می دهد که مقادیر y بیشتر در نزدیک تر از خط پراکنده شده اند تا دورتر. فرض (1) دلالت بر این دارد که این توزیع های نرمال بر روی خط متمرکز هستند: میانگین این توزیع های نرمال مقادیر y روی خط قرار دارند.
  • انحراف استاندارد مقادیر y جمعیت در مورد خط برای هر مقدار x برابر است. به عبارت دیگر، هر یک از این توزیع های نرمال مقادیر y شکل و گسترش یکسانی در اطراف خط دارند.
  • خطاهای باقیمانده متقابل مستقل هستند (بدون الگو).
  • داده ها از یک نمونه تصادفی خوب طراحی شده یا آزمایش تصادفی تولید می شوند.

مقادیر y برای هر مقدار x معمولاً در مورد خط با همان انحراف استاندارد توزیع می شود. برای هر مقدار x، میانگین مقادیر y در خط رگرسیون قرار دارد. مقادیر y بیشتر در نزدیکی خط قرار دارند تا مقادیر دورتر از خط.

بررسی مفهوم

Linear regression is a procedure for fitting a straight line of the form [latex]displaystylehat>=+[/latex] به داده ها. شرایط رگرسیون عبارتند از:

  • خطی: در جامعه، یک رابطه خطی وجود دارد که میانگین مقدار y را برای مقادیر مختلف x مدل می کند.
  • مستقل: باقیمانده ها مستقل فرض می شوند.
  • Normal: مقادیر y به طور معمول برای هر مقدار x توزیع می شود.
  • واریانس برابر: انحراف معیار مقادیر y برای هر مقدار x برابر است.
  • تصادفی: داده ها از یک نمونه تصادفی خوب طراحی شده یا آزمایش تصادفی تولید می شوند.

شیب b و قطع a از خط حداقل مربعات، شیب β و قطع α خط رگرسیون جمعیت (واقعی) را تخمین می زنند. برای تخمین انحراف استاندارد جمعیت y , σ , از انحراف استاندارد باقیمانده ها s استفاده کنید.

[latex]displaystyle=sqrt>>>>>>[/latex] متغیر ρ (rho) ضریب همبستگی جمعیت است.

برای آزمون فرضیه صفر H0: ρ = مقدار فرضی، از آزمون t رگرسیون خطی استفاده کنید. رایج ترین فرضیه صفر H است0: ρ = 0 که نشان می دهد هیچ رابطه خطی بین x و y در جامعه وجود ندارد.

تابع ماشین حساب TI-83، 83+، 84، 84+ LinRegTTest می تواند این آزمایش را انجام دهد (STATS TESTS LinRegTTest).

بررسی فرمول

Least Squares Line or Line of Best Fit: [latex]displaystylehat>=+[/لاتکس]

انحراف استاندارد باقیمانده ها:

SSE = مجموع خطاهای مربع

n = تعداد نقاط داده

مجوزها و ویژگی ها محتوای دارای مجوز CC ، که قبلاً به اشتراک گذاشته شده است

  • OpenStax ، آمار ، آزمایش اهمیت ضریب همبستگی. ارائه شده توسط: OpenStax. واقع در: http://cnx. org/contents/30189442-6998-4686-ac05-ed152b91b9de@17. 41:83/introductory_statistics. مجوز: CC توسط: انتساب
  • آمار مقدماتی. تألیف شده توسط: باربارا ایلاوسکی ، سوزان دین. ارائه شده توسط: Open Stax. واقع در: http://cnx. org/contents/30189442-6998-4686-ac05-ed152b91b9de@17. 44. مجوز: CC توسط: انتساب. شرایط مجوز: بارگیری به صورت رایگان در http://cnx. org/contents/30189442-6998-4686-ac05-ed152b91b9de@17. 44 < Pan> انحراف استاندارد باقیمانده ها:
فارکس به زبان ساده...
ما را در سایت فارکس به زبان ساده دنبال می کنید

برچسب : نویسنده : طاهره ایرانی بازدید : <-PostHit-> تاريخ : شنبه 21 مرداد 1402 ساعت: 18:06