2015年4月21日 星期二

在前言凸顯賣點的方法

1.在前言比較前面的段落提到賣點的關鍵字,例如:unidimensionality。

2.在主題句提到賣點,並專段撰寫。例如:unidimensionality的意義與價值、interval score的應用與價值、大樣本可使結果比較穩定分別用一段撰寫。

只說:賣點不凸顯,並不是一個明確的建議。

2015年4月16日 星期四

OTK衛教研究之人數估計

以下為以G power軟體使用OTK衛教預試的結果預估之收案人數。
 

核心價值
生理OT
實驗組平均
7
7.25
對照組平均a
13.25
15.5
實驗組得分之標準差
2.83
5.32
對照組得分之標準差a
1.26
0.71
ES (d)
2.853
2.17
Power
0.8
0.8
一組所需人數
4
5
a 因為收案困難,此處之對照組得分為實驗組之前測分數。

由於生理OT所需人數比較多,所以我取人數多的結果,至少需10位個案/家屬。

考量流失率(預估30%)的問題,需招募16人(無條件進入並且湊成偶數之結果)。

2015年4月2日 星期四

2015/3/23報告記錄:確認目前的衛教是預試或正式收案

報告內容:OTK衛教內容與實施方式
報告目的:確認目前的衛教是預試或正式收案

I.        概念釐清
A.      看實施方式的判斷依據:1)研究設計可否達成研究目的。2)研究設計是否可行。
B.      實驗組與對照組的病人與家屬應如何達到配對的隨機分派,以確保二組的個案與人數比例相近
C.      目前的研究設計,最直接的結果應該是OTK測驗的分數。但這對臨床人員/個案的意義有限,他們重視的還是臨床上的成效。然而臨床成效的影響因子眾多,可能衛教之後,臨床成效的提升仍然有限。所以要探討可能影響蒐集可能影響OTES與ADL CAT的因素。到底OTK增加之後,為什麼ADL會提升?
II.      研究設計:
A.      將同時收個案與家屬改為可收個案或家屬,並進行配對的隨機分派以確保二組的個案與人數比例相近。
B.      個別化衛教的成果比較方式:比較的時候可以做組內和組間的比較。組內的比較就是個人的前後測差異,組間的則是共同題的前後測差異。
*
衛教一定要個別化,才能符合個案/家屬的需求。
C.      列出明確的收案條件,整理清楚中風個案/家屬未能參與研究的原因與各原因相對的人數,並加入流程圖中。
表、個案與家屬拒絕的原因
個案未能參與的原因
家屬未能參與的原因
個案有其它重大疾病診斷(例如:帕金森、癌症、失智症)
-
個案隔離
-
個案病情不穩,無法定期上OT
-
個案即將出院
-
認知能力受損(例如:失語症)
無意願參與
不識字
不識字
聽不懂國語
聽不懂國語
治療時間滿,想要休息
時間無法配合
無意願參與
收案時未遇到家屬(已向治療師詢問,治療師表示家屬晚上才會來)
*橘底為不符合收案標準,直接排除。白底為符合條件者拒絕的原因。

III.    報告時的注意事項:下次討論時需列出自己的困難與希望聽到建議的部分。
IV.    下次討論前需要準備的資料
A.      整理目前衛教測驗分數彙整,分2個面向(OT核心價值、生理OT)估計所需的樣本數
B.      寄信給老師和怡靜2個面向的題目。

C.      進行配對的隨機分派的作法。

2015年4月1日 星期三

[Rasch] person reliability的意義(待確認)

Person reliability是羅序分析的信度指標。
但是我不太瞭解person reliability的概念應該如何解釋。
以下是我整理自己的概念之後,對於person reliability的概念說明。

錯誤理解:person reliability與Cronbach's α 是類似的概念,數值通常也差不多。

正確的概念:person reliability是由每個人能力估計的標準誤 (standard error, SE)所計算出來的數值。當SE越小,person reliability越大,表示這個工具能夠越精準地估計人的能力。
Cronbach's α 是由題目間的相關所計算出來的數值。當題目間相關越高,Cronbach's α值越大,表示題目越相似。
然而,當題目過於相似,Cronbach's α 會很大,但是在羅序分析中,可能就無法準確估計到某些能力的人。例如:題目難度集中在中間,在估計能力偏高或偏低的人時,SE就會很大。
當SE大,person reliability就會小。
因此 person reliability和Cronbach's α是不一樣的。

[Rasch]階難度沒有倒置 (disordering)的概念、意義、圖示與處理方法

階難度沒有倒置 (disordering)的定義:
在羅序分析當中,如果使用PCM進行分析,每題都會得到一組階難度的估計值。若由階難度的數值由低階排到高階是按照由小到大的順序,則表示沒有倒置。

階難度沒有倒置的意義:
1.表示每個選項都有人作答,而且不會有那個選項的作答人數特別少。
2.無多餘的選項。
Ref. Hsiao, Y.Y., et al., Examining unidimensionality and improving reliability for the eight subscales of the SF-36 in opioid-dependent patients using Rasch analysis. Qual Life Res, 2014.

呈現有無倒置的適當圖示:The response category probability curve

左圖為沒有倒置的作答機率曲線。每條曲線表示每個選項在所有能力的情況下被選到的機率。而每個選項在不同的能力狀況下,都有機會是最可能被選到的選項。例如能力值落在-0.4~-0.1,最可能被選到的選項是2。
右圖為有倒置的作答機率曲線。選項2的曲線在任何時候都低於其它曲線。表示這一群作答者幾乎沒有人選2。

發現階難度有倒置的處理方法:
1.不處理。因為這可能是這一群作答者的特性。換一群作答者不一定會有倒置的情況。
2.合併選項再重新分析。例如:將0-1-2-3合併成0-1-2,把原本的2和3合併成一個選項。

階難度倒置的錯誤解釋:
disordering of the step, indicating that the response categories could not effectively differentiate the patients from each other and were thus redundant.
Ref. Hsieh, C.L., et al., A Rasch analysis of the Frenchay Activities Index in patients with spinal cord injury. Spine (Phila Pa 1976), 2007. 32(4): p. 437-42.


2015年3月17日 星期二

判斷異常作答需考量的事(項目反應理論)

最近要看一筆資料的作答情況是否異常,再決定是要刪除人或是刪除量表題目。
異常作答的概念是指不該得高分的人得了高分,不該得低分的人得了低分。
在教育領域出現異常作答,最常見的原因有可能是猜測或作弊。

實際判斷異常作答的時候,我認為有二個議題需要考量:
1.在那個能力範圍內算是合理?

合理的意思是當人的能力超過某個範圍,就應該答對或答錯(或者得高分/低分)。
但是範圍的界定並沒有一定的標準。因為每一題的試題難度估計都有誤差,如果是採二參數或三參數模式分析,還須考量鑑別度的問題。
所以到底這個能力範圍應該設定多寬,會是個問題。

我目前是把題目難度±1當作範圍的界定依據(因為題目難度的誤差通常不會超過1,所以我以大約2個標準差作為判斷依據)。
在這個範圍之內,我認為答對答錯都有可能(或者每個選項都有可能)。
當人的能力超過某個範圍,就不應該答對或答錯(或得最低/最高分)了!


2.那種作答結果算是異常?
當題目是二分題(只有對錯或是否),判斷上比較容易。
只要當人的能力超過某個範圍,就不應該答對或答錯(或得最低/最高分)了!
但是,當題目是多點計分,例如:1-2-3-4-5,過了我們限定的範圍之後,作答者合理的作答反應到底是什麼呢?是123與345嗎?
可是,當作答者能力在最高/低的時候還得3分合理嗎?
而且,也沒有一個臨界點可以作為判斷標準:只要能力在某個範圍之內,作答者一定只會得4分,絕對不會得5分。
通常只有機率高低的問題,沒有一定。

我目前是把能力大於題目難度+1的人當作高分群,高分群不可能得1、2分。
能力小於題目難度-1的人當作低分群,低分群不可能得4、5分。
至於得3分的人,只在能力最高和能力最低的人看是否有出現,以判斷異常。

以上是我的一點想法,歡迎大家分享意見。

2015年3月15日 星期日

增加OTK衛教人數的可能方法

因為願意參與OTK衛教的人數過少,所以我想了幾個可能可以增加收案人數的方法,以改善原本的研究設計之不足。
這些方法應該可以合併使用。
又,如果一個時段有二人願意參與,可考慮二人同時進行衛教。

原本的研究設計:
參與者:中風個案或家屬(註:更早之前的參與者為中風個案與家屬,但目前的名單沒有符合此條件的參與者)
流程:參與者每日接受0.5-1小時的衛教(約需3日才能完成),並於衛教前後一日完成OTK測驗。
衛教時間:個案接受治療的時間、家屬/個案有空的時間


可能的方法一:
邀請對象:中風個案或家屬
流程:個案或家屬同意參與之後,立即完成前測
                  ↓
            約1次完整的時間,把1.5-2小時的衛教內容講完
                  ↓
            衛教後隔日進行後測
衛教時間:家屬/個案有空的時間
優點:縮短研究所需天數,可以收到快出院的個案
缺點:仍需要同一位家屬參與3次、個案或家屬不一定願意抽1.5-2小時聽OTK


可能的方法二:
邀請對象:中風家屬
流程:發意願調查表給晚上才會出現的家屬(請個案或看護轉交)
                  ↓
            家屬同意參與之後,立即完成前測
                  ↓
            約1次完整的時間,把1.5-2小時的衛教內容講完(日夜皆可)
                  ↓
            衛教後隔日進行後測
優點:(1)縮短研究所需天數,可以收到快出院的個案家屬。(2)配合家屬到院時間提供衛教,可能可以找到較多家屬。
缺點:(1)仍需要同一位家屬參與3次。(2)個案或家屬不一定願意抽1.5-2小時聽OTK。(3)家屬在晚上已經累了,不想聽衛教。

2015年2月10日 星期二

[思考]把原始分數轉為等距量尺 (interval scale) 的意義為何?

我最近看了一些羅序分析的文章,部分文章的研究目的是把量表的原始分數(通常為序列量尺)轉換為等距量尺 (interval scale)的型態。
然而我有一個疑問:如果量表應用於特定族群的羅序分析的結果只能應用在驗證的族群上(例如:SCI一年以上、中風後半年),
當驗證的族群比較侷限的時候,將量表分數轉為等距量尺的意義是否很有限?
例如:分數只適用於中風後半年的人,而此分數未必適用於中風未滿半年或半年以上的人,因為這些人參數估計的結果未必和中風後剛好半年的人相似。

我的想法是:如果驗證的對象涵蓋範圍比較廣,像是中風後半年以上、慢性思覺失調症,
把量表的原始分數轉換為等距量尺的分數以供後人對照與參考,意義較大。
如果驗證的對象涵蓋範圍較窄,像是職業災害後一個月、中風後三個月,
把量表的原始分數轉換為等距量尺則比較像是附加產品或中間產物,目的是要進行下一步的運算(例如計算反應性)。

不知道這樣的想法是否合理?
再麻煩大家提供意見囉!謝謝。

2015年2月9日 星期一

OTK測試報告

狀況一、衛教時間不易控制
有些受訪者會在衛教過程中問問題,有些完全不問,造成衛教時間長度的差異(二者約差10-15分鐘)。
此外,當受訪者問問題,我會講得更多或更深入,也可能影響受訪者最後的作答情形。

狀況二、個案招募不易
目前以2週的時間僅完成4位家屬的預試(原本預計預試5位個案、5位家屬)。招募家屬人數不如預期的原因可能有二:
1.家屬常為輪流照顧個案,不易約到固定一位家屬接受衛教。
2.家屬有些晚上才會出現,個案白天是由看護照顧,因此我們在治療室遇不到家屬,也難以邀請家屬參與研究。

招募不到中風個案的原因可能有四:
1.
要找到認知狀況好又願意參與研究的中風個案頗為困難。
2.
一週內參與5次,對個案的負擔太大。降低個案參與的意願。
3.
個案的治療行程很滿,其它時間則需要休息、會客與搶浴室,不一定有空參與研究。
4.
認知功能好的個案通常一週左右就會出院,無法完成研究。

狀況三:受訪者並不想知道太多細節,通常會想知道大標題與少數細節
以本次預試的受訪者為例,他們會想知道接受OT可達成的目標、OT常見的治療方法有那些,然後從中挑較有興趣的細節深入瞭解。

狀況四:受訪者可能精神狀況不佳
參與本研究的家屬通常為長時間陪同個案接受治療的人,而他們甚至還要在照顧病人之餘兼顧工作與照顧其他家人。
因此部分受訪者接受衛教時總是看起來十分疲憊,可能不利於衛教。

狀況五、衛教成效不易比較
每個人選擇要瞭解的衛教內容不同,難以比較成果。
受訪者
編號
前_核心價值
前_輔具
中心
前_生理OT
前_長期
照護
前_職業
重建
後_核心
價值
後_輔具
中心
後_生理OT
後_長期
照護
後_職業
重建
1
5
.
0
.
.
6
.
7
.
.
2
3
6
6
6
0
6
8
6
10
7
3
7
7
6
5
.
7
7
7
8
.
4
4
6
6
6
.
7
8
6
9
.
*空格內的數字為該面向的測驗得分。

2015年1月20日 星期二

請教王老師的問題記錄:measurement invariance的判斷指標、後續處理、CFA和Rasch analysis分析結果的差異

主題一、Measurement invariance的判斷指標
Measurement invariance是古典測驗理論的用語,表示量表在不同族群、時間點使用這個量表,皆可以得到相似的心理計量特性。此概念在IRT當中,就是此量表沒有差別試題功能 (differential item functioning, DIF)。
補充:DIF的定義為不同種類(例如:年齡、性別、教育程度)但能力相同的個人,如果在答對某個試題上的機率有所不同的話,則該試題便顯現出 DIF 的現象。
Measurement invariance可謂一種理想,實際上沒有完美的量表。因此就看使用者願意接受多少的不完美。


以下為對於幾個指標的驗證方法的說明:
1.單一因素結構:可視量表的用途決定MNSQ可接受的範圍,例如把範圍從0.6 - 1.4 改為  0.8 - 1.2,以調高標準。

2.題目難度排序:題目難度排序做直接比較。但須思考比較題目難度的排序是否恰當。如果有題目的難度排序變化過大,則可考慮不採計此題的結果,改以共通題的分數估計這題可能的分數。

3.題目難度值:可計算不同時間檢的題目難度之相關,或看各題得分的平均與變化量。

4. Person reliability:可用Spearman-Brown formula計算量表的信度0.89時,要增加幾題才能變成0.92。如果不需增加很多題目,就可視為信度是穩定的。


主題二、若工具不具備Measurement invariance,應如何處理?
驗證Measurement invariance之前,需先說明為何會擔心不一致?為何要驗證特定變項對一致性的影響?不一致又會造成什麼結果。
若量表的使用目的是作為重要的判斷依據(例如疾病診斷或大型考試的錄取判別),則可容忍的誤差程度比較低。
若量表的使用目的是用於團體比較,可允許的誤差較大。

關於是否需刪題,如果題目太少,就不一定要刪題。

主題三、若CFA單因素分析與Rasch分析結果不同,應採信何者?
二者概念不同,不可直接比較。
有時候CFA為單因素,Rasch分析結果不是單因素,並不表示Rasch比較寬鬆。
而是因為我們採用寬鬆的標準看待Rasch分析的結果。
如果改用嚴格的標準,例如:MNSQ改用0.8-1.2的標準,量表未必就會符合單向度。