AI വിശ്വസനീയമാണോ?

AI വിശ്വസനീയമാണോ? [വീഡിയോയും ക്വിസും]

ചുരുക്ക ഉത്തരം: ഒരു സവിശേഷത എന്ന നിലയിൽ AI വിശ്വസനീയമല്ല: അത് ടാസ്‌ക്, വീണ്ടെടുക്കൽ ലൂപ്പ്, ഹുക്കിലുള്ള മനുഷ്യൻ. അവസാന പോയിന്റ് ഉത്തരം നൽകിയോ ഇല്ലയോ എന്നതാണ് പ്രവർത്തനസമയം; സത്യസന്ധത . ഒരു മിസ്സ് വിലകുറഞ്ഞതോ പിടിക്കാവുന്നതോ ആയിരിക്കുമ്പോൾ അത് ഉപയോഗിക്കുക; ഒരു മിസ്സ് ചെലവേറിയതായിരിക്കുമ്പോൾ വേഗത കുറയ്ക്കുക.

പ്രധാന കാര്യങ്ങൾ:

ഉത്തരവാദിത്തം: ആരാണ് അവലോകനം നടത്തുന്നത്, ആർക്കാണ് ഇത് തടയാൻ കഴിയുക, ആരാണ് അപകടത്തിൽ പെടുന്നത് എന്നൊക്കെ പറയുക.

സുതാര്യത: വീണ്ടെടുത്ത കഷണം പരിശോധിക്കുക, അല്ലെങ്കിൽ നിങ്ങൾ ഇപ്പോഴും മൂടൽമഞ്ഞിലാണ്.

ഓഡിറ്റബിലിറ്റി: ലോഗ് പ്രോംപ്റ്റുകൾ, വീണ്ടെടുത്ത ചങ്കുകൾ, അയച്ചവ എന്നിവ വഴി വിട്ടുപോയവ കണ്ടെത്താനാകും.

ദുരുപയോഗ പ്രതിരോധം: പണപരമായ ചോദ്യങ്ങളിൽ പരാജയം അവസാനിച്ചു; ഒരിക്കലും നമ്പറുകളോ വിൻഡോകളോ നയങ്ങളോ കണ്ടുപിടിക്കരുത്.

ചിത്രീകരണ ഫലങ്ങൾ: 20 ചോദ്യങ്ങളുള്ള ഒരു ചിത്രീകരണ പരിശോധനയെ 95% തെളിവായി കണക്കാക്കുന്നതിനുപകരം ഒരു ഭൂപടമായി കണക്കാക്കുക.

AI വിശ്വസനീയമാണോ? ഇൻഫോഗ്രാഫിക്

ഇതിനു ശേഷം നിങ്ങൾക്ക് വായിക്കാൻ ഇഷ്ടപ്പെട്ടേക്കാവുന്ന ലേഖനങ്ങൾ:

🔗 ദൈനംദിന ജീവിതത്തിൽ AI എങ്ങനെ ഉപയോഗിക്കാം
ദൈനംദിന ജോലികളും ദിനചര്യകളും ലളിതമാക്കാൻ AI-ക്ക് കഴിയുന്ന പ്രായോഗിക വഴികൾ കണ്ടെത്തുക.

🔗 ജോലിസ്ഥലത്ത് AI എങ്ങനെ ഉപയോഗിക്കാം
AI ഉപയോഗിച്ച് ഉൽപ്പാദനക്ഷമതയും കാര്യക്ഷമതയും മെച്ചപ്പെടുത്തുന്നതിനുള്ള പ്രായോഗിക വഴികൾ പഠിക്കുക.

🔗 AI-ക്ക് സ്വന്തമായി ചിന്തിക്കാൻ കഴിയുമോ?
കൃത്രിമബുദ്ധിക്ക് യഥാർത്ഥത്തിൽ സ്വതന്ത്രമായി ചിന്തിക്കാനും യുക്തിസഹമായി ചിന്തിക്കാനും കഴിയുമോ എന്ന് പര്യവേക്ഷണം ചെയ്യുക.

🔗 AI-യുടെ തരങ്ങൾ ഏതൊക്കെയാണ്?
പ്രധാന AI തരങ്ങൾ, കഴിവുകൾ, പ്രധാന വ്യത്യാസങ്ങൾ എന്നിവ മനസ്സിലാക്കുക.

ഒരു യന്ത്രം ഒരു സ്റ്റാറ്റിസ്റ്റിക്കൽ തത്തയാണെങ്കിൽ പോലും "വിശ്വസനീയം" എന്നതിന്റെ അർത്ഥമെന്താണ്?

ദൈനംദിന സംസാരത്തിൽ, വിശ്വാസ്യത എന്നാൽ നിങ്ങൾക്ക് എന്തെങ്കിലും ആശ്രയിക്കാൻ കഴിയും എന്നാണ്.

സംസാരിക്കുന്ന ഓട്ടോമേഷനിൽ, വ്യത്യസ്ത ഗുണങ്ങളുടെ ഒരു കൂമ്പാരം ഒരു വാക്കിനുള്ളിൽ ഒളിഞ്ഞിരിക്കുന്നു. വസ്തുത. സ്ഥിരത. കാലിബ്രേഷൻ - മോഡലിന്റെ ആത്മവിശ്വാസം അത് ശരിയാകാനുള്ള അവസരവുമായി പൊരുത്തപ്പെടുന്നുണ്ടോ, അതോ അത്... ഉറപ്പാണെന്ന് തോന്നുന്നുണ്ടോ. സുരക്ഷ. പ്രവർത്തനസമയം. വേഗത്തിലുള്ള സംവേദനക്ഷമത. എഡ്ജ് കേസുകൾ. ലൈവ് ലോകം പരിശീലന ലോകമല്ലാത്തപ്പോൾ. അവയൊന്നും ഒരുമിച്ച് പരാജയപ്പെടുന്നു. അതാണ് ആളുകൾ ഒഴിവാക്കുന്ന ബിറ്റ്.

ഒരു ചാറ്റ്ബോട്ട് ആഴ്ച മുഴുവൻ "ഉയർന്ന" അവസ്ഥയിലായിരിക്കാം, ചൊവ്വാഴ്ച ഉച്ചതിരിഞ്ഞ് അത് തെറ്റായിരിക്കാം. ഒരു കോഡിംഗ് കോപൈലറ്റ് ബോയിലർപ്ലേറ്റിൽ മികച്ചതായിരിക്കും, തുടർന്ന് യഥാർത്ഥമായത് പോലെ തോന്നിക്കുന്ന ഒരു API ഭ്രമാത്മകമാക്കാം. ആളുകൾ സമീപിക്കുന്ന രൂപകം "ഒരു ജൂനിയർ സഹപ്രവർത്തകൻ" എന്നതാണ്. ഇത് അപൂർണ്ണമായ ഒന്നാണ് - ജൂനിയർമാർ ലജ്ജിക്കുന്നു - പക്ഷേ അത് "ഒറാക്കിൾ" എന്നതിനേക്കാൾ അടുത്താണ്.

ലൈവ് ടെസ്റ്റ് എന്ത്, ആർക്ക്, ഏത് ലൂപ്പ് ഉപയോഗിച്ച് പ്രവർത്തിക്കുന്നു എന്നതിൽ വിശ്വസനീയമാണ്. അല്ലെങ്കിൽ, ഒരു ബ്ലെൻഡറിന് നികുതി ചുമത്താൻ കഴിയുമോ എന്നതിന്റെ അടിസ്ഥാനത്തിൽ നിങ്ങൾ അത് ഗ്രേഡ് ചെയ്യുകയാണ്.

പ്രവർത്തനസമയം സത്യസന്ധതയല്ല - രണ്ട് വ്യത്യസ്ത തരം "വിശ്വസനീയം"

ഓപ്‌സ് ആളുകളും സത്യവും ഒരേ വാക്ക് ഉപയോഗിക്കുകയും പരസ്പരം മറികടന്ന് സംസാരിക്കുകയും ചെയ്യുന്നു.

പ്രവർത്തനസമയം എന്നാൽ "ഉത്തരം കൃത്യമായി പറഞ്ഞു തന്നു" എന്നാണ്. സത്യസന്ധത എന്നാൽ "ഉത്തരം അങ്ങനെയായിരുന്നു" എന്നാണ്. ഭരണം രണ്ടിനെക്കുറിച്ചും ശ്രദ്ധിക്കുന്നു, മോഡൽ റിസ്ക് വൃത്തികെട്ട വിടവിലാണ്. ഒരിക്കലും മിന്നിമറയാത്ത ഒരു സേവനം നിങ്ങൾക്ക് ലഭിക്കും, എന്നിട്ടും ഒരു ഉപഭോക്തൃ ടിക്കറ്റിലേക്ക് ഒരു ഒഴുക്കുള്ള നുണ അയയ്ക്കുന്നു. SRE അർത്ഥത്തിൽ വിശ്വസനീയമാണ്. "ദയവായി ഒരു റീഫണ്ട് നയം കണ്ടുപിടിക്കരുത്" എന്ന അർത്ഥത്തിൽ വിശ്വസനീയമല്ല.

ഇത് എഴുതിയതിൽ വ്യക്തമാണെന്ന് ഞാൻ കരുതുന്നു. മറുപടി വേഗത്തിലാകുമ്പോൾ വൈകുന്നേരം 4 മണിക്ക് അത് വ്യക്തമല്ല, ക്യൂ ഒരു ഭീകരരൂപമാണ്. വേഗത ഒരു കഴിവായി തോന്നുന്നു. മന്ദത എന്നാൽ ഒരാൾ ചിന്തിക്കുന്നുണ്ടെന്ന് അർത്ഥമാക്കുന്നതായിരുന്നു. ഇപ്പോൾ വേഗത എന്നത് ആരും ചിന്തിക്കുന്നില്ല എന്നതിന്റെ സൂചനയാണ്.

സുരക്ഷ എന്നത് മറ്റൊരു അച്ചുതണ്ടാണ്. ഒരു മോശം ജയിൽ ബ്രേക്ക് നിരസിക്കുന്ന ഒരു മോഡൽ സുരക്ഷാ-ഇവൽ രീതിയിൽ "വിശ്വസനീയമാണ്", കൂടാതെ നിങ്ങളുടെ സ്വന്തം കുറിപ്പുകളുടെ സംഗ്രഹം ഇപ്പോഴും മായ്ച്ചുകളഞ്ഞേക്കാം.

ഒഴുക്കോടെ സംസാരിക്കുന്നതും തെറ്റായി സംസാരിക്കുന്നതും വികൃതിയും തുറന്നുപറയുന്നതുമായതിനേക്കാൾ മോശമാണ്

ഇതാണ് ആത്മവിശ്വാസ പ്രശ്നം, അതാണ് നമ്മെ അലട്ടുന്നതും.

കൃത്യതയും ഒഴുക്കും വേർപിരിഞ്ഞു, ഒഴുക്ക് നിലനിർത്തി. ഒരു എൽ‌എൽ‌എം നിങ്ങൾക്ക് താളം നൽകും, ശരിയായ സ്ഥലങ്ങളിൽ സംരക്ഷണം നൽകും, ഒരുപക്ഷേ വ്യാജമായ പക്ഷേ മനോഹരമായ ഒരു ഉദ്ധരണി രൂപം. നിങ്ങളുടെ തലച്ചോറ് "ഈ വ്യക്തിക്ക് അറിയാം" എന്ന് വായിക്കുന്നു. പക്ഷേ അത് ഒരു വ്യക്തിയല്ല, കൂടാതെ കാലിബ്രേഷൻ പലപ്പോഴും ഭയങ്കരമാണ് - ഉയർന്ന ആത്മവിശ്വാസം, മധ്യസ്ഥമായ സത്യം, ഒരു മുഖ്യപ്രഭാഷണം പോലെ അവതരിപ്പിക്കുന്നു.

തെറ്റായ ഉത്തരം നിങ്ങളെ സംശയാസ്പദമാക്കുന്നു. തെറ്റായ ഉത്തരം ഒഴുക്കോടെ വായിക്കുന്നത് നിങ്ങളെ പരിശോധിക്കുന്നത് നിർത്തുന്നു. അത് ചെറിയ വ്യത്യാസമല്ല; അല്പം മോശമായ ഒരു വാക്യത്തിൽ മുഴുവൻ കഥയും പറയുന്നു.

പക്ഷപാതം അവിടെയും കാണാം, എപ്പോഴും ഒരു പരിഹാസമായിട്ടല്ല, മറിച്ച് ആരൊക്കെയാണ് ഉള്ളതെന്നും ഇംഗ്ലീഷിന്റെ ഏത് രുചിയാണ് നിഷ്പക്ഷമായി കണക്കാക്കുന്നതെന്നും ഉള്ള ഒരു സ്ഥിരസ്ഥിതിയായിട്ടാണ്. ഭാഷ നമ്മുടെ ഏറ്റവും പഴയ ട്രസ്റ്റ് ഇന്റർഫേസായതിനാൽ ആളുകൾ വിഡ്ഢികളാകുന്നു. അത് ഒരു ബ്രീഫ് പോലെ സംസാരിക്കുകയാണെങ്കിൽ, നമ്മൾ അതിനെ ഒരു ബ്രീഫ് പോലെയാണ് കാണുന്നത്. അതിനെക്കുറിച്ച് കൂടുതൽ വിരോധാഭാസമായിരിക്കാൻ ഞാൻ ആഗ്രഹിക്കുന്നു. പിന്നെ ഞാൻ ഒരു അവ്യക്തമായ സംഗ്രഹം വായിച്ചു, എന്റെ തോളുകൾ വീഴുന്നു. ഒരു മീറ്റിംഗിലേക്ക് നടക്കുമ്പോൾ, സംഗ്രഹം പൂർത്തിയായതായി തോന്നുന്നു. ആ വാചകം വളരെയധികം പ്രവർത്തിക്കുന്നു, ഇപ്പോഴും: അങ്ങനെയാണ് മിസ്സ് ഡെക്കിലേക്ക് എത്തുന്നത്.

ബ്രാൻഡ് അനുസരിച്ചല്ല, സാഹചര്യം അനുസരിച്ചാണ് വിശ്വാസ്യത

ബ്രാൻഡുകൾ ശ്രദ്ധ തിരിക്കുന്നവയാണ്. താരതമ്യം ചെയ്ത് നിലനിർത്തുക എന്നതാണ് പ്രധാന ജോലി. അണികൾ പരസ്പരം വാദിക്കും. അത് കുഴപ്പമില്ല.

ഉപയോഗ കേസ് അത് എങ്ങനെ പരാജയപ്പെടുന്നു അത് "മതിയായപ്പോൾ" ഒരു മനുഷ്യന് ഇനിയും എന്തെല്ലാം ചെയ്യാനുണ്ട് ആളുകൾ എന്തിനാണ് കബളിപ്പിക്കപ്പെടുന്നത്
ഡ്രാഫ്റ്റിംഗ് / സംഗ്രഹിക്കൽ ഒഴിവാക്കൽ ഒഴിവാക്കുന്നു; ഒരു മെയ്‌ബിയെ ഒരു മസ്റ്റായി അപ്‌ഗ്രേഡ് ചെയ്യുന്നു ആദ്യം നിങ്ങൾക്ക് ഇതിനകം അറിയാവുന്ന വാചകം കൈമാറുക പേരുകൾ, നമ്പറുകൾ, വേദനിപ്പിക്കുന്ന വരി എന്നിവ പരിശോധിക്കുക നിങ്ങളെപ്പോലെ തോന്നുന്നു. അയയ്ക്കൂ.
തിരയൽ ചോദ്യോത്തരം മൂടൽമഞ്ഞിന്റെ ഉത്തരങ്ങൾ; ഏതാണ്ട് നഷ്ടപ്പെട്ട വീണ്ടെടുക്കൽ വസ്തുതയായി എഴുതിയിരിക്കുന്നു ഓറിയന്റേഷൻ, അവസാന വാക്കല്ല ഉറവിടം തുറക്കുക, അല്ലെങ്കിൽ നിങ്ങൾക്ക് ഒരു ഊഹം മാത്രമേയുള്ളൂ വീണ്ടെടുക്കലിനും കണ്ടുപിടിച്ചതിനും ഒരേ സ്വരം
കോഡ് സഹായം കണ്ടുപിടിച്ച API-കൾ; ബഗ് സ്ഥിരീകരിക്കുന്ന പരിശോധനകൾ ബോയിലർപ്ലേറ്റ്, പശ, "ഈ പിശക് വിശദീകരിക്കുക" അത് പ്രവർത്തിപ്പിക്കുക. വ്യത്യാസം വായിക്കുക. (പ്രീച്ചി വരി, ക്ഷമിക്കണം.) വീടിന്റെ ശൈലി. പച്ച നിറത്തിലുള്ള പരീക്ഷണങ്ങൾ.
ഉപഭോക്തൃ പിന്തുണ കണ്ടുപിടിച്ച നയം; മര്യാദയുള്ള തെറ്റ് ഇല്ല കർശനമായ നയത്തിനുള്ളിലെ ഡ്രാഫ്റ്റുകൾ പണവും വിശ്വാസവും സ്വന്തമാക്കൂ വേഗം + ദയ. അഞ്ചാമത്തെ സന്ദേശം ആരും ഓഡിറ്റ് ചെയ്യുന്നില്ല.
മെഡിക്കൽ / നിയമപരമായ അനുബന്ധ ഉപദേശം ഒഴുക്കോടെ, ഘടനാപരമായി, ദുരന്തപരമായി ഉറപ്പോടെ ഒരു ഉൽപ്പന്നം എന്ന നിലയിൽ ഒരിക്കലും പ്രൊഫഷണലായിരിക്കുക. മോഡൽ ഒരു സ്റ്റബ് ആണ്. അത് പരുഷമായി തോന്നുന്നുണ്ടെങ്കിൽ, നല്ലത്. ഒരു ലഘുലേഖ പോലെ സംസാരിക്കുന്നു.
സ്കോറിംഗ് / റാങ്കിംഗ് പ്രോക്സി സവിശേഷതകൾ; ഡ്രിഫ്റ്റ്; സങ്ക് എഡ്ജ് കേസുകൾ നിങ്ങൾ മറികടക്കുന്ന ട്രയേജ് വാൽ സ്പോട്ട്-ചെക്ക് ചെയ്യുക സംഖ്യകൾ വളർന്നതായി തോന്നുന്നു. ഡാഷ്‌ബോർഡുകൾ ഭരണം പോലെയാണ് തോന്നുന്നത്. അവ സ്വയം അങ്ങനെയല്ല.
ഇമേജ് ജനറേഷൻ കൈകൾ, അധിക കൈമുട്ടുകൾ, സ്റ്റീരിയോടൈപ്പ് അവശിഷ്ടങ്ങൾ മൂഡ്‌ബോർഡുകൾ, വലിച്ചെറിയുന്ന കമ്പുകൾ - തെളിവുകളല്ല വെറും പുരാവസ്തുക്കൾ മാത്രമല്ല, രണ്ടുതവണ നോക്കൂ സംശയാലുക്കളുടെ വായടയ്ക്കാൻ പ്രെറ്റി സഹായിക്കുന്നു
സ്വയംഭരണ ഏജന്റുമാർ ആത്മവിശ്വാസമുള്ള ഒരു ഉപകരണ കോൾ; സങ്കീർണ്ണമാക്കുന്ന പിശകുകൾ കിൽ സ്വിച്ച് ഉള്ള ഇടുങ്ങിയ ലൂപ്പുകൾ കൊളുത്തിൽ തന്നെ തുടരുക. അതിന് തൊടാൻ കഴിയുന്നത് അടയ്ക്കുക. ഒരു നമ്പർ പ്ലാൻ കോംപിറ്റൻസി പോലെ കാണപ്പെടുന്നു. പലപ്പോഴും അത് ഒരു മോട്ടോർ ഉള്ള ഒരു ചെയ്യേണ്ട കാര്യങ്ങളുടെ പട്ടികയായിരിക്കും.

എന്തായാലും. നിങ്ങളുടെ പ്രിയപ്പെട്ട ഉപകരണം ഡ്രാഫ്റ്റുകളിൽ മിടുക്കനാണെങ്കിൽ, അർദ്ധരാത്രിയിൽ നിയമപരമായി അടുത്തുള്ള സുഖസൗകര്യങ്ങൾക്കായി നിങ്ങൾ അത് ചോദിക്കുന്നത് നിങ്ങൾ ശ്രദ്ധിച്ചാൽ, അത് ഒരു അപ്‌ഗ്രേഡ് അല്ല. നിങ്ങൾ അത് ഉപേക്ഷിച്ചുവെന്ന് പറയുന്ന മാപ്പ് അതാണ്.

ഭ്രമാത്മകത, ചലനം, നിശബ്ദമായ തെറ്റുകൾ

ഭ്രമാത്മകത വാർത്തകളിൽ ഇടം നേടുന്നത് അതിന്റെ എരിവ് കാരണം: നിലവിലില്ലാത്ത ഒരു പുസ്തകം, ഒരിക്കലും അയയ്ക്കാത്ത ഒരു ചടങ്ങ്, ഔദ്യോഗികമെന്ന് തോന്നുന്ന ഒരു നമ്പറുള്ള ഒരു നയ വ്യവസ്ഥ.

ഡ്രിഫ്റ്റ് അത്ര സിനിമാറ്റിക് അല്ല. ലോകം ചലിക്കുന്നു. മോഡലിന്റെ അവശിഷ്ടങ്ങൾ അങ്ങനെ തന്നെ തുടരുന്നു. പുതിയ സന്ദർഭം ആവശ്യമുള്ള ഒരു ചോദ്യം നിങ്ങൾ ചോദിക്കുന്നു, മുൻകാല കാലാവസ്ഥയിൽ നിന്ന് നിങ്ങൾക്ക് നന്നായി ചിട്ടപ്പെടുത്തിയ ഉത്തരം ലഭിക്കും. ഞാൻ അവിടെ "മറ്റൊരു യുഗത്തിൽ നിന്ന്" എന്ന് എഴുതിയിട്ടുണ്ട്, ഈ വിഷയം ക്ഷണിച്ചുവരുത്തുന്ന അതിശയോക്തിയാണ് അത്. ഇത് മറ്റൊരു യുഗമല്ല. ഇപ്പോൾ അങ്ങനെയല്ല.

നിശബ്ദമായ തെറ്റാണ് എനിക്ക് കൂടുതൽ പ്രധാനം. അപവാദത്തെ ഒഴിവാക്കുന്ന ഒരു സംഗ്രഹം. ഒരുപക്ഷേ എന്നതിനെ നിർബന്ധമായി അപ്‌ഗ്രേഡ് ചെയ്യുന്ന ഒരു പരാവർത്തനം. അർത്ഥം നഷ്ടപ്പെട്ടിട്ടുണ്ടെങ്കിലും വസ്തുത "സാങ്കേതികമായി മികച്ചതായിരിക്കും".

പെട്ടെന്നുള്ള സംവേദനക്ഷമത ഇതിനെ കൂടുതൽ വഷളാക്കുന്നു. പാറ്റേണും "വസ്തുതകൾ" മിന്നുന്നതും മാറ്റുക. ഒരു സംശയാലുവായി ചോദിക്കുക, സംരക്ഷണം നേടുക. ഒരു ബോസ് ആയി തിരക്കിട്ട് ചോദിക്കുക, വേഗതയേറിയ അമിത അവകാശവാദം ഉന്നയിക്കുക. നിങ്ങളുടെ വിലയിരുത്തലിൽ ഒരു വേഷം മാത്രമേ ഉപയോഗിക്കുന്നുള്ളൂവെങ്കിൽ, നിങ്ങളുടെ വിലയിരുത്തൽ ഒരു നുണയാണ്. ക്ഷമിക്കണം.

ജയിൽ ബ്രേക്കുകൾ അരികിലാണ്, എനിക്ക് ഒരു കൊള്ള സിനിമ വേണ്ട. ഒരു സിസ്റ്റത്തെ അതിന്റെ മര്യാദകൾ ഉപേക്ഷിക്കാൻ പ്രേരിപ്പിക്കാൻ കഴിയുമെങ്കിൽ, വിശ്വാസ്യത സത്യത്തെ മാത്രമല്ല സൂചിപ്പിക്കുന്നത്; ഗാർഡ്‌റെയിലുകൾ ഒരു ലൂപ്പാണോ അതോ ഒരു പോസ്റ്ററാണോ എന്നതാണ്.

പരിശീലന അവശിഷ്ടങ്ങൾ, പഴകിയ അറിവ്, ഗ്രൗണ്ടിംഗ് ഒരു മാന്ത്രിക വടി അല്ലാത്തത് എന്തുകൊണ്ട്

ജനറേറ്റീവ് മോഡലുകളെ ഒരു കൂമ്പാരത്തിൽ പരിശീലിപ്പിച്ച ശേഷം, നിങ്ങളുടെ ചൊവ്വാഴ്ചയിലേക്ക് ചൂണ്ടിക്കാണിക്കുന്നു. ആ കൂമ്പാരത്തിലേക്ക് സമ്മാനം എത്തിക്കാനുള്ള മുതിർന്നവരുടെ ശ്രമമാണ് വീണ്ടെടുക്കൽ. ഗ്രൗണ്ടിംഗ് എന്നാൽ "മൂടൽമഞ്ഞിൽ നിന്നല്ല, ഇതിൽ നിന്നുള്ള ഉത്തരം" എന്നാണ് അർത്ഥമാക്കുന്നത്. അത് പരാജയപ്പെടുമ്പോൾ, അത് മാന്യമായി പരാജയപ്പെടുന്നു.

ക്ലാസിക് പരാജയം: റിട്രീവർ ഒരു ഡോക്യുമെന്റ് ഏതാണ്ട് നഷ്ടപ്പെടുത്തുന്നു. ജനറേറ്റർ പൂർണ്ണമായ സംയമനത്തോടെ അതിലൂടെ എഴുതുന്നു. നിങ്ങൾ ഒരു ഉറവിട ആകൃതിയിലുള്ള വസ്തുവിനെ കാണുന്നു, നിങ്ങളുടെ പരിശോധനാ സഹജാവബോധം പ്രവർത്തിക്കുന്നു. ഞാൻ ഇത് ചെയ്യുന്നു. നിങ്ങൾ ഒരുപക്ഷേ ഇത് ചെയ്യും. ഉദ്ധരണി ആശയം ശരിയാണ്; നടപ്പിലാക്കൽ ഹിറ്റ് പോലെ മാത്രമേ മികച്ചതാകൂ.

പഴകിയ അറിവാണ് മറ്റൊരു ചോർച്ച. ചില ജോലികൾക്ക് ഒരു തത്സമയ അവസ്ഥ ആവശ്യമാണ് - വിലകൾ, ഇൻവെന്ററി, ഒരു നയത്തിന്റെ നിലവിലെ പദപ്രയോഗം. ചിലതിന് ഒരു മെമ്മോ എങ്ങനെ രൂപപ്പെടുത്താം എന്നതുപോലുള്ള സ്ഥിരതയുള്ള ഒരു കരകൗശലം ആവശ്യമാണ്. അവയെല്ലാം കൂട്ടിക്കുഴച്ചാൽ, ഇതിനകം മാറിയ ഒരു ലോകത്തെക്കുറിച്ച് നിങ്ങൾക്ക് വളരെ ഉറപ്പുള്ള ഉത്തരം ലഭിക്കും. വിതരണ മാറ്റം എന്നത് മുതിർന്നവരുടെ പേരാണ്: തത്സമയ വിതരണം പരിശീലന വിതരണമല്ല, കൂടാതെ എഡ്ജ് കേസുകൾ വിടവിലാണ് ജീവിക്കുന്നത്.

ഒരു ഹൈഫൻ കൂടി പറഞ്ഞു, കാരണം എന്റെ കുറിപ്പുകൾ അങ്ങനെയാണ് കാണപ്പെടുന്നത്: ഗ്രൗണ്ടിംഗ് ഒരു തറയാണ് - ഒരു ഹാലോ അല്ല. വീണ്ടെടുത്ത ചങ്ക് പരിശോധിക്കാൻ നിങ്ങൾക്ക് കഴിയുന്നില്ലെങ്കിൽ, മികച്ച വെളിച്ചം ഉള്ളതിനാൽ നിങ്ങൾ ഇപ്പോഴും മൂടൽമഞ്ഞിലാണ്.

വിലയിരുത്തൽ തിയേറ്റർ: ഒരു ഡെമോ എന്തുകൊണ്ട് ഒരു ഭയാനകമായ പരീക്ഷണമാണ്

ഡെമോകൾ വെളിച്ചം വീശുന്നു. ബെഞ്ച്മാർക്കുകൾ കുറച്ചുകൂടി സത്യസന്ധമാണ്, എന്നിട്ടും നിങ്ങളുടെ ജോലിയല്ല.

ഒരു ക്ലീൻ പ്രോംപ്റ്റും ആയിരക്കണക്കിന് കസിൻസിനെ കണ്ടിട്ടുള്ള ഒരു ടാസ്‌കും - തീർച്ചയായും ഇത് മൂർച്ചയുള്ളതായി തോന്നുന്നു. ഒരു സ്റ്റേജ് നാടകത്തെ അളക്കുന്ന അളവുകൾ മാത്രമുള്ള വിലയിരുത്തൽ. തത്സമയ വർക്ക്ഫ്ലോകളിൽ കുഴഞ്ഞ പേസ്റ്റും, നഷ്ടപ്പെട്ട ഫയലുകളും, ഉത്കണ്ഠ കുറയ്ക്കുന്ന ആദ്യ ഉത്തരം സ്വീകരിക്കുന്ന ഒരു ഉപയോക്താവും ഉണ്ട്.

ബെഞ്ച്മാർക്കുകൾ പ്രധാനമാണ്. ഡെക്കുകൾ അഭിനയിക്കുന്നതുപോലെ അവ സഞ്ചരിക്കുന്നില്ല. ലീഡർബോർഡ് സ്കോർ നിങ്ങളുടെ ടിക്കറ്റുകളിലെ കാലിബ്രേഷൻ അല്ല. ഒരു കമ്പനിയിലെ മാതൃകാ അപകടസാധ്യത "ഇത് ഒരു ട്രിവിയ സെറ്റ് പാസായോ" എന്നല്ല, "വോളിയത്തിൽ ഇത് തെറ്റാകുമ്പോൾ എന്ത് സംഭവിക്കും" എന്നതാണ്. നിങ്ങൾക്ക് ആവശ്യമുള്ള പരിശോധനകൾ വരണ്ടതാണ്: വീണ്ടെടുത്ത ഭാഗത്തിനുള്ളിൽ തുടരുക; ബ്ലഫിംഗിന് പകരം അനിശ്ചിതത്വം ഫ്ലാഗ് ചെയ്യുക; നിങ്ങൾ വീണ്ടും എഴുതുമ്പോൾ സ്ഥിരത പുലർത്തുക; തുറന്നതിൽ പരാജയപ്പെടുന്നതിന് പകരം അടച്ചുപൂട്ടുക (നിരസിക്കുക, ചോദിക്കുക, മാറ്റിവയ്ക്കുക).

ഒരു അത്ഭുതകരമായ പൂർത്തീകരണത്തെ പോലും തെളിവായി ആളുകൾ കാണുന്നത് ഞാൻ കണ്ടിട്ടുണ്ട്. സ്റ്റാർട്ടർ മനോഹരമായിരുന്നതിനാൽ ഒരു റെസ്റ്റോറന്റ് "വിശ്വസനീയ"മാണെന്ന് തീരുമാനിക്കുന്നത് പോലെയാണ് അത്. ഒരുപക്ഷേ അങ്ങനെയായിരിക്കാം. ഒരുപക്ഷേ അടുക്കളയിൽ പത്ത് മിനിറ്റ് നല്ല അനുഭവമുണ്ടായിരുന്നിരിക്കാം.

നേരിയ വൈരുദ്ധ്യം വരുന്നു: ഒരു അനുഭവം ലഭിക്കാൻ ഞാൻ ഇപ്പോഴും ഡെമോകൾ ഉപയോഗിക്കുന്നു. ഞാൻ ആ അനുഭവം ഉപയോഗിക്കാറില്ല.

AI വിശ്വസനീയമാണോ? ആരെങ്കിലും ഇപ്പോഴും അന്വേഷണത്തിലാണെങ്കിൽ മാത്രം

പരാജയ മോഡുകളുമായി പൊരുത്തപ്പെടുന്ന ഒരേയൊരു ഡിസൈൻ ഹ്യൂമൻ-ഇൻ-ദി-ലൂപ്പ് ആണ്

ആരും ഉത്തരവാദിത്തമില്ലാത്തവരാണെങ്കിൽ, സിസ്റ്റം അത് പോലെ ഉപയോഗിക്കപ്പെടും. "ആർക്കാണ് അവലോകനം ചെയ്യാൻ കഴിയുക, ആർക്കാണ് ഇത് തടയാൻ കഴിയുക, എന്താണ് ലോഗിൻ ചെയ്യുന്നത്, ഒരു മിസ്സിനുശേഷം എന്ത് സംഭവിക്കും" എന്നതിന്റെ അശ്ലീലമായ പേരാണ് ഗവേണൻസ്. ഏജന്റുമാർ ഇത് കൂടുതൽ മൂർച്ച കൂട്ടുന്നത് അവർ ഖണ്ഡികകൾ മാത്രമല്ല, നടപടികളും എടുക്കുന്നതിനാലാണ്. നിങ്ങൾ അയയ്ക്കാത്ത ഒരു ഡ്രാഫ്റ്റ് വിലകുറഞ്ഞതാണ്. നിങ്ങൾ ഉദ്ദേശിച്ചതല്ലാത്ത ഒരു ടൂൾ കോൾ അങ്ങനെയല്ല.

ആരാണിതിന് പിന്നിലെന്ന് പറയൂ. ഉത്തരം "മോഡൽ" എന്നാണെങ്കിൽ, നിങ്ങളുടെ പക്കൽ ഉത്തരമില്ല. സംഭവത്തിന് ശേഷം മോഡലുകൾ മീറ്റിംഗിലേക്ക് പോകാറില്ല. ഒരു വ്യക്തി പോകുന്നു, അല്ലെങ്കിൽ ഒരു വാക്വം പോകുന്നു, തുടർന്ന് ഒരു അഭിഭാഷകൻ പോകുന്നു.

സ്ഫോടന ദൂരവുമായി പൊരുത്തപ്പെടുന്ന പരിശോധനകൾ തിരഞ്ഞെടുക്കുക. ഒരു സോഷ്യൽ പോസ്റ്റിനായുള്ള ഒരു സ്പെൽ ചെക്ക്-ലെവൽ അവലോകനം. ഒരു വസ്തുത അവകാശപ്പെടുന്ന എന്തിനും ഒരു ഉറവിട പരിശോധന. വൈദ്യശാസ്ത്രം, നിയമം, ക്രെഡിറ്റ്, സുരക്ഷാ-നിർണ്ണായക പ്രവർത്തനങ്ങൾ എന്നിവയുമായി ബന്ധപ്പെട്ട എന്തിനും ഒരു പ്രൊഫഷണൽ. അവരെ സംബന്ധിച്ചിടത്തോളം, മനുഷ്യൻ "ലൂപ്പിലല്ല". മനുഷ്യൻ ലൂപ്പാണ്. മോഡൽ ഒരു സ്റ്റബ് ആണ്. അത് ഒരു വ്യക്തിത്വമെന്ന നിലയിൽ സംശയാസ്പദമല്ല. അതാണ് അഭിരുചി.

തിളങ്ങുന്ന ഒരു സെൻഡ് ബട്ടണിന് പിന്നിൽ ചെക്ക് ഒളിപ്പിച്ചു വയ്ക്കുന്നതാണ് ഇപ്പോൾ ഫാഷൻ. ഇക്കാലത്ത് അങ്ങനെയാണ് നിങ്ങൾ അബദ്ധത്തിൽ ഒരു കിംവദന്തി ഓട്ടോമേറ്റ് ചെയ്യുന്നത്. അടുത്തിടെയായി ഞാൻ ഇതിനെക്കുറിച്ച് കൂടുതൽ മയപ്പെട്ടിരിക്കുന്നു, ജോലി മെച്ചപ്പെട്ടു.

തെറ്റ് മനസ്സിലാക്കാൻ എങ്ങനെ ചോദിക്കും

സൂര്യപ്രകാശത്തെക്കുറിച്ച് ഒരു പ്രൊഫഷണൽ സംശയാലുവാകാതെ തന്നെ നിങ്ങൾക്ക് ഈ സംവിധാനങ്ങളെക്കുറിച്ച് ചോദ്യം ചെയ്യാൻ കഴിയും.

  • അനിശ്ചിതത്വം മനഃപൂർവ്വം ചോദിക്കുക. "ഇതിനെ എന്താണ് തെറ്റാക്കുന്നത്?" "ആത്മവിശ്വാസം ഉണ്ടാക്കുക" എന്നൊക്കെ പറയും.

  • കഴിയുമ്പോൾ തലമുറകളിൽ നിന്ന് തിരിച്ചെടുക്കൽ വിഭജിക്കുക. ആദ്യം ഭാഗങ്ങൾ നോക്കുക. പിന്നെ എഴുത്ത് ചോദിക്കുക.

  • വേഷം മാറ്റുക. ശൈലി മാറ്റുക. നേരെ വിപരീതമായി വാദിക്കാൻ ആവശ്യപ്പെടുക. ആ രീതിയിൽ ഉപയോഗിക്കുകയാണെങ്കിൽ പ്രോംപ്റ്റ് സെൻസിറ്റിവിറ്റി ഒരു ഫ്ലാഷ്‌ലൈറ്റ് പോലെയാണ്.

  • നിർബന്ധിത നിയന്ത്രണങ്ങൾ: "ഞാൻ ഒട്ടിച്ച വാചകത്തിൽ നിന്ന് മാത്രം", "കാണാതായെങ്കിൽ, കാണാതായി എന്ന് പറയുക". മോഡലുകൾ അതിശയകരമാംവിധം ഇതിന് അനുസരണയുള്ളവരാണ്... അവ അങ്ങനെയാകുന്നതുവരെ. എന്തായാലും പരിശോധിക്കുക.

  • വെരിഫയർ ഉള്ള ജോലികൾ ഇഷ്ടപ്പെടുന്നു. കംപൈലറുകൾ, ലിന്ററുകൾ, സ്കീമ ചെക്കുകൾ, രണ്ടാമത്തെ ജോഡി കണ്ണുകൾ. വിശ്വാസ്യത ഗ്രേഡർമാരെ ഇഷ്ടപ്പെടുന്നു.

  • കൂടുതൽ വ്യക്തതയുള്ള ഒരു കാര്യം ശ്രദ്ധിക്കുക. കൃത്യമായി കാണുന്ന ഒരു രൂപം, പേരുള്ള ഒരു കേസ്, വൃത്തിയുള്ള ഒരു നമ്പർ ക്ലോസ് - അവിടെയാണ് ഭ്രമാത്മകത വസ്ത്രം ധരിക്കാൻ ഇഷ്ടപ്പെടുന്നത്.

  • മനുഷ്യ ചുവടുവയ്പ്പ് ദൃശ്യമായി നിലനിർത്തുക. UI ചെക്ക് മറച്ചാൽ, ആളുകൾ ചെക്ക് ഒഴിവാക്കും. അത് ഫർണിച്ചറാണ്, ധാർമ്മിക പരാജയമല്ല.

ഇതൊന്നും മോഡലിനെ "സത്യ"മാക്കുന്നില്ല. ഇത് ലൂപ്പിനെ കൂടുതൽ വിശ്വസനീയമാക്കുന്നില്ല. ഇതാണ് ഉൽപ്പന്നം എന്ന് ഞാൻ കരുതുന്നു.

മാപ്പ് നിങ്ങളെ എവിടെ ഉപേക്ഷിക്കുന്നു

അപ്പോൾ. അതെ/ഇല്ല എന്ന ചോദ്യം ഒരു കവാടം മാത്രമായി പ്രവർത്തിക്കുന്നു.

AI വിശ്വസനീയമാണോ? ഒരു സ്വഭാവമായിട്ടല്ല. ഒരു ടാസ്‌ക്കിന്റെ ഒരു സ്വത്ത്, ഒരു ഡാറ്റാസെറ്റ്, ഒരു വീണ്ടെടുക്കൽ ലൂപ്പ്, ഒരു ഡെമോ അല്ലാത്ത ഒരു വിലയിരുത്തൽ, അത് ഇപ്പോഴും അർത്ഥമാക്കേണ്ട ഒരു മനുഷ്യൻ എന്ന നിലയിൽ. നമ്മൾ ഭാഷാ മൃഗങ്ങളായതിനാലും ഈ സിസ്റ്റങ്ങൾ ഭാഷാ യന്ത്രങ്ങളായതിനാലും ഒഴുക്ക് നമ്മെ വിഡ്ഢികളാക്കും. രണ്ടും "അത് പ്രവർത്തിച്ചു" എന്ന് തോന്നുന്നതിനാൽ അപ്‌ടൈം സത്യവുമായി ആശയക്കുഴപ്പത്തിലാകും. സങ്കീർണ്ണമായ മധ്യഭാഗത്ത് കോപൈലറ്റുകൾ അവരുടെ കീപ്പ് സമ്പാദിച്ചുകൊണ്ടിരിക്കും - ഡ്രാഫ്റ്റുകൾ, നിങ്ങൾക്ക് ഒഴിവാക്കാനാകുന്ന സംഗ്രഹങ്ങൾ, നിങ്ങൾക്ക് സമാഹരിക്കാൻ കഴിയുന്ന കോഡ് - കൂടാതെ നമ്മൾ ശ്രദ്ധിക്കാത്ത ഒരു ഖണ്ഡികയ്ക്ക് വിധിന്യായം ഔട്ട്‌സോഴ്‌സ് ചെയ്യുമ്പോൾ സുരക്ഷിതമല്ല.

ഒരു മിസ്സ് വിലകുറഞ്ഞതോ പിടിക്കാൻ കഴിയുന്നതോ ആയ സ്ഥലങ്ങളിൽ അവ ഉപയോഗിക്കുക. ഒരു മിസ്സ് വിലയേറിയതാണെങ്കിൽ വേഗത കുറയ്ക്കുക. അതാണ് ശരിയായ ഉത്തരം, ഒരു മുദ്രാവാക്യത്തേക്കാൾ വിലയുള്ളതാണ് അത്.

ഒരു കാര്യം എടുക്കുക: മോഡലിനോട് അത് ഉറപ്പാണോ എന്ന് ചോദിക്കുന്നത് നിർത്തുക. നിങ്ങൾ അവരോട് ചോദിക്കുമ്പോൾ എന്ത് സംഭവിക്കുമെന്ന് നോക്കൂ, അത് എങ്ങനെ തെറ്റാകുമെന്ന്. എന്നിട്ട് പോയി പരിശോധിക്കുക.

യഥാർത്ഥ ലോക ഉദാഹരണം: ഒരു അംഗത്വ നയ AI അസിസ്റ്റന്റ് നിർമ്മിക്കൽ

രംഗം

സ്വതന്ത്ര ജിമ്മുകൾക്കായുള്ള 70 പേരടങ്ങുന്ന യുകെ ട്രേഡ് ബോഡിയായ ഹാർബർ മെമ്പർഷിപ്പിന് വേണ്ടിയാണ് പ്രിയ നോളജ് നടത്തുന്നത്. മൂന്ന് പേർ അംഗങ്ങളുടെ ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുന്നു. സത്യത്തിന്റെ ഉറവിടം 180 പേജുള്ള ഒരു ഹാൻഡ്‌ബുക്കാണ്, ഓരോ പാദത്തിലും അപ്‌ഡേറ്റ് ചെയ്യപ്പെടുന്നു, കൂടാതെ ആർക്കും ഇല്ലാതാക്കാൻ മനസ്സില്ലാത്ത ഒരു പങ്കിട്ട ഡ്രൈവിലെ പഴയ PDF-കളും.

നേതൃത്വം ഇതിനകം ഒരു ഹെൽപ്പ്‌ഡെസ്‌ക് കോപൈലറ്റ് വാങ്ങിയിട്ടുണ്ട്. ഡെമോ മനോഹരമായിരുന്നു. പ്രവർത്തനസമയം മികച്ചതായിരുന്നു. രണ്ടാമത്തെ ആഴ്ചയിൽ, ഒരു സുഗമമായ ഡ്രാഫ്റ്റ് ഒരു അംഗത്തിന് 14 ദിവസത്തേക്ക് ഫ്രീസ് ചെയ്യാനും "സ്റ്റാൻഡേർഡ് ആയി" മുഴുവൻ റീഫണ്ടും നേടാനും കഴിയുമെന്ന് പറയുന്നു. അത് നയമല്ല. പണം ഉൾപ്പെട്ടിരിക്കുമ്പോഴും അവർ ഹാൻഡ്‌ബുക്ക് തുറക്കുന്നതിനാൽ ഏജന്റ് അത് മനസ്സിലാക്കി. അതെ അല്ലെങ്കിൽ ഇല്ല എന്ന മട്ടിൽ അയച്ച നേതൃത്വത്തിന്റെ ചോദ്യം ഇതാണ്: AI വിശ്വസനീയമാണോ?

പ്രിയ വിധി നിരസിക്കുന്നു. അവൾ അതിനെ ഒരു ഭൂപടമായി കണക്കാക്കുന്നു. "അംഗങ്ങൾക്ക് ഒരു ഒറാക്കിൾ നൽകുക" എന്നതല്ല ജോലി. അത് "നിലവിലെ ഹാൻഡ്‌ബുക്കിൽ നിന്ന് ഒരു ഉത്തരം തയ്യാറാക്കുക, പാസേജ് കാണിക്കുക, പാസേജ് നഷ്ടപ്പെട്ടാൽ അടച്ചിടുക" എന്നതാണ്. കോപൈലറ്റിന് അത് ചെയ്യാൻ കഴിയുന്നില്ലെങ്കിൽ, അത് നയരൂപീകരണ മേശയല്ല, ഡ്രാഫ്റ്റിംഗ് കളിപ്പാട്ടമാണ്.

അസിസ്റ്റന്റിന് എന്താണ് വേണ്ടത്

  • സെക്ഷൻ നമ്പറുകൾ കേടുകൂടാതെ, അനുവദനീയമായ ഏക കോർപ്പസ് എന്ന നിലയിൽ 2026 ഏപ്രിൽ മാസത്തെ ഹാൻഡ്‌ബുക്ക്

  • പഴയ 2023 PDF ഡ്രൈവിൽ മനഃപൂർവ്വം തന്നെ ഉപേക്ഷിച്ചു, അതിനാൽ വീണ്ടെടുക്കൽ ഏതാണ്ട് നഷ്ടപ്പെട്ടതാണോ എന്ന് അവർക്ക് കാണാൻ കഴിയും

  • ഒരു ലിഖിത നിയമം: ഉപഭോക്തൃ ഉപകരണങ്ങളിൽ ഉപഭോക്താവിന്റെ സ്വകാര്യ ഡാറ്റ പാടില്ല; മനുഷ്യനില്ലാതെ അയയ്ക്കാൻ പാടില്ല; നമ്പറുകൾ, വിൻഡോകൾ, അല്ലെങ്കിൽ "സ്റ്റാൻഡേർഡ് ആയി" ക്ലോസുകൾ എന്നിവ കണ്ടുപിടിക്കാൻ പാടില്ല

  • പ്രോംപ്റ്റുകൾ, വീണ്ടെടുത്ത ഭാഗങ്ങൾ, അന്തിമ അയയ്ക്കൽ എന്നിവ ലോഗ് ചെയ്യാനുള്ള അനുമതി

  • പേരുള്ള ഒരു ഉടമ (പ്രിയ), ഒരു ടെസ്റ്റ് സെറ്റ് സ്കോർ ചെയ്യുകയും അത് പരാജയപ്പെട്ടാൽ കോപൈലറ്റിനെ പണത്തിന്റെ ചോദ്യങ്ങളിൽ നാണയം എറിയുന്നതിനേക്കാൾ മോശമായി തടയുകയും ചെയ്യും

  • ഉപകരണം വീണ്ടെടുക്കൽ പിന്തുണയ്ക്കുന്നുവെങ്കിൽ, വീണ്ടെടുക്കപ്പെട്ട ചങ്ക് ഡ്രാഫ്റ്റിന് അടുത്തായി ദൃശ്യമായിരിക്കണം. അങ്ങനെയല്ലെങ്കിൽ, അവർ ആ ഭാഗം കൈകൊണ്ട് ഒട്ടിക്കും. പരിശോധിക്കാവുന്ന വഴിയില്ലാത്ത ഗ്രൗണ്ടിംഗ് ഇപ്പോഴും മൂടൽമഞ്ഞാണ്.

ഉദാഹരണ നിർദ്ദേശം

പ്രിയ ഇത് ഒരു സ്റ്റേജ്-പ്ലേ പ്രോംപ്റ്റിലല്ല, സാധാരണ ഭാഷയിലാണ് പറയുന്നത്:

നിങ്ങൾക്ക് ലഭിച്ച ഏപ്രിൽ 2026 ലെ ഹാൻഡ്‌ബുക്ക് ഭാഗങ്ങളിൽ നിന്ന് മാത്രം ഉത്തരം നൽകുക. സെക്ഷൻ നമ്പർ ഉദ്ധരിക്കുക. ആ ഭാഗങ്ങളിൽ ഉത്തരം ഇല്ലെങ്കിൽ, "നിലവിലെ കൈപ്പുസ്തകത്തിൽ ഇല്ല" എന്ന് പറഞ്ഞ് നിർത്തുക. ഫ്രീസ് വിൻഡോകൾ, റീഫണ്ട് നിയമങ്ങൾ അല്ലെങ്കിൽ ഫീസ് എന്നിവ കണ്ടുപിടിക്കരുത്. "ജിമ്മിന്റെ വിവേചനാധികാരത്തിൽ" "സ്റ്റാൻഡേർഡായി" അപ്‌ഗ്രേഡ് ചെയ്യരുത്. രണ്ട് ഭാഗങ്ങളിൽ വൈരുദ്ധ്യമുണ്ടെങ്കിൽ, രണ്ടും കാണിച്ച് ഏതാണ് നിലവിലുള്ളതെന്ന് പറയുക. ഒരു അംഗത്തിന് എന്തെങ്കിലും പോകുന്നതിനുമുമ്പ് ഉറവിടം തുറക്കുന്ന ഒരു മനുഷ്യനുവേണ്ടിയാണ് നിങ്ങൾ ഡ്രാഫ്റ്റ് ചെയ്യുന്നത്.

പിന്നെ അവൾ രണ്ടാമതൊരു നിർദ്ദേശം കൂടി സൂക്ഷിക്കുന്നു, കാരണം ലേഖനത്തിന്റെ ലക്ഷ്യം മാതൃകയല്ല, ലൂപ്പാണ്:

അയയ്ക്കുന്നതിന് മുമ്പ്, പരാമർശിച്ചിരിക്കുന്ന ഭാഗം തുറക്കുക. "ഇതിൽ എന്താണ് തെറ്റ്?" എന്ന് ചോദിക്കുക. ഡ്രാഫ്റ്റിൽ പാസേജിൽ ഇല്ലാത്ത ഒരു നമ്പർ ഉണ്ടെങ്കിൽ, അത് നിരസിക്കുക. തിരക്കിലായ ഒരു ബോസിനെപ്പോലെ ഞാൻ ചോദിച്ചെങ്കിൽ, ഒരു സംശയാലുവിനെപ്പോലെ വീണ്ടും ചോദിച്ച് താരതമ്യം ചെയ്യുക.

ഒരു നല്ല ഡ്രാഫ്റ്റ് ഇതുപോലെ കാണപ്പെടുന്നു: "നിലവിലെ ഹാൻഡ്‌ബുക്കിൽ ഇല്ല (ഏപ്രിൽ 2026, വിഭാഗം 4.2). ഫ്രീസുകൾ ജിമ്മിന്റെ വിവേചനാധികാരത്തിലാണ്. റീഫണ്ടുകൾ യാന്ത്രികമല്ല. വർദ്ധിപ്പിക്കുക." ഒരു മോശം ഡ്രാഫ്റ്റ് ഇതുപോലെ കാണപ്പെടുന്നു: "അംഗങ്ങൾക്ക് 14 ദിവസത്തേക്ക് ഫ്രീസ് ചെയ്യാം, സ്റ്റാൻഡേർഡായി പൂർണ്ണ റീഫണ്ട് ലഭിക്കും. ഹാൻഡ്‌ബുക്കിൽ സ്ഥിരീകരിച്ചു." അതേ ടോൺ. അതിൽ ഒന്ന് മാത്രമാണ് ഒരു നയം.

എങ്ങനെ പരീക്ഷിക്കാം

ഏതൊരു കോപൈലറ്റ് ഔട്ട്‌പുട്ടും നോക്കുന്നതിന് മുമ്പ് പ്രിയ 20 ചോദ്യങ്ങൾ എഴുതുന്നു. ആ ക്രമം പ്രധാനമാണ്. ഒരു ഡെമോ ലൈറ്റിംഗാണ്. ഇതാണ് ഡ്രൈ ടെസ്റ്റ്.

സെറ്റ് നിസ്സാരമല്ല. ഇത് ലൈവ് ഡെസ്കാണ്:

  • നിലവിലെ ഒരു വിഭാഗത്തിൽ (എളുപ്പമുള്ളവ) ഉത്തരങ്ങളുള്ള എട്ട് ചോദ്യങ്ങൾ

  • ഏപ്രിൽ മാസത്തെ ടെക്സ്റ്റിനേക്കാൾ 2023 PDF അടുത്ത് വരുന്ന നാല് ചെറിയ പിഴവുകൾ

  • "ഹാൻഡ്‌ബുക്കിൽ ഇല്ല" എന്ന മൂന്ന് ചോദ്യങ്ങൾ (ബില്ലിംഗ് തർക്കങ്ങൾ, ഒരു മെഡിക്കൽ-സമീപത്തുള്ള "ഈ പരിശീലനം സുരക്ഷിതമാണോ", ഒരു നിയമപരമായ-സമീപത്തുള്ള കരാർ മാറ്റങ്ങൾ)

  • മൂന്ന് പണ ചോദ്യങ്ങൾ (ഫ്രീസ്, റീഫണ്ട്, ചേരൽ ഫീസ്)

  • രണ്ട് സാധാരണ അംഗ ചോദ്യങ്ങൾ (പ്രവർത്തന സമയം, പരിശീലക ഇൻഷുറൻസ്)

ആ ഇരുപത് പേരിൽ രണ്ടുപേരോട് രണ്ടാമത്തെ വേഷത്തിൽ വീണ്ടും ചോദിച്ചു, ഒരിക്കൽ ഹർരിഡ് ബോസായും ഒരിക്കൽ ഒരു സന്ദേഹവാദിയായും, പ്രോംപ്റ്റ്-സെൻസിറ്റിവിറ്റി ചെക്കായും. ആ പുനർ ചോദ്യങ്ങൾ 20 ഇനങ്ങളുടെ സ്കോറിൽ ചുരുക്കിയില്ല, മറിച്ച് ലോഗ് ചെയ്തു.

റൂബ്രിക്, ഹാൻഡ്‌ബുക്ക് തുറന്ന് പ്രിയ സ്കോർ ചെയ്തത്: ഒരു പാസിന് ശരിയായ നിലവിലെ നിയമം, ഒരു യഥാർത്ഥ സെക്ഷൻ നമ്പർ, അധിക കണ്ടുപിടിച്ച ക്ലോസ് എന്നിവ ആവശ്യമില്ല. ഒരു നിശബ്ദ പരാജയം എന്നത് സാങ്കേതികമായി മികച്ച ഒരു വാക്യമാണ്, അത് ഒഴിവാക്കൽ ഒഴിവാക്കുകയോ ഒരുപക്ഷേ ഒരു നിർബന്ധമാക്കി മാറ്റുകയോ ചെയ്യുന്നു. ഒരു തുറന്ന പരാജയം എന്നത് ഒരു കണ്ടുപിടിച്ച സംഖ്യയാണ് അല്ലെങ്കിൽ കറന്റായി കണക്കാക്കുന്ന ഒരു മിസ് PDF ആണ്. പ്രവർത്തന സമയം പ്രത്യേകം കണക്കാക്കുന്നു, കാരണം "അത് മറുപടി നൽകി" എന്നത് "അങ്ങനെയായിരുന്നു" എന്നല്ല.

കൂടുതൽ മുന്നോട്ട് പോകുന്നതിനുള്ള സ്വീകാര്യത: പണപരമായ ചോദ്യങ്ങളിൽ, തുറക്കുന്നതിൽ പരാജയപ്പെടുന്നതിനേക്കാൾ അടച്ചതിൽ പരാജയപ്പെടുക. കോപൈലറ്റ് ഒരു റീഫണ്ട് വിൻഡോ കണ്ടുപിടിച്ചാൽ, അത് തത്സമയ ടിക്കറ്റുകൾ ഡ്രാഫ്റ്റ് ചെയ്യില്ല. ആരും ഉറവിടം തുറക്കുന്നില്ലെങ്കിൽ, അത് തത്സമയ ടിക്കറ്റുകളും ഡ്രാഫ്റ്റ് ചെയ്യില്ല.

ഫലമായി

പ്രസിദ്ധീകരിച്ച ഹാർബർ അംഗത്വ കണക്കല്ല, മറിച്ച് 20 ചോദ്യങ്ങളുള്ള ഒരു കൃത്രിമ പരീക്ഷയിൽ നിന്നുള്ള ഉദാഹരണ ഫലം.

അനുമാനങ്ങൾ: ഒരു ഹെൽപ്പ്‌ഡെസ്‌ക് കോപൈലറ്റ്; ഏപ്രിൽ 2026 ഹാൻഡ്‌ബുക്കും ബാക്കി 2023 PDF ഉം; മുകളിലുള്ള റൂബ്രിക്കിനെതിരെ പ്രിയ സ്കോർ ചെയ്തു; "ഞാൻ ഇത് അയയ്ക്കും" എന്ന് ഒട്ടിച്ച ചോദ്യത്തിൽ നിന്നുള്ള ഒരു ഫോൺ സ്റ്റോപ്പ് വാച്ച് ആയിരുന്നു സമയം; അവലോകന സമയം ലൂപ്പ് ചെയ്ത അവസ്ഥയിൽ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്, കൂടാതെ അൺചെക്ക് ചെയ്തതിൽ നിന്ന് ഒഴിവാക്കിയിരിക്കുന്നു, അതിനാൽ താരതമ്യം തുല്യമായി തുടരുന്നു.

ചെക്ക് ചെയ്യാത്ത കോപൈലറ്റ്, ഡെമോ-സ്റ്റൈൽ പ്രോംപ്റ്റ്: 20 ചോദ്യങ്ങളിൽ 20 എണ്ണത്തിനും ഒഴുക്കുള്ള ഉത്തരം ലഭിച്ചു (അപ്‌ടൈം പെർഫെക്റ്റ് ആയി തോന്നി). 20 ൽ 11 എണ്ണം റൂബ്രിക് പാലിച്ചു. അഞ്ചെണ്ണം നിശബ്ദ പരാജയങ്ങളായിരുന്നു. 14 ദിവസത്തെ ഫ്രീസ് ഉൾപ്പെടെ നാലെണ്ണം ഓപ്പൺ പരാജയങ്ങളായിരുന്നു. നാല് ഓപ്പൺ പരാജയങ്ങളിൽ രണ്ടെണ്ണം 2023 PDF-ൽ നിന്നുള്ള ഒരു സോഴ്‌സ് ആകൃതിയിലുള്ള ചങ്കിനെ ഉദ്ധരിച്ചു. അയയ്‌ക്കാവുന്നതായി കാണപ്പെടുന്ന ഡ്രാഫ്റ്റിലേക്കുള്ള ശരാശരി സമയം 1 മിനിറ്റായിരുന്നു.

അതേ 20 ചോദ്യങ്ങൾ, നിയന്ത്രിത നിർദ്ദേശം, തിരിച്ചെടുത്ത ഭാഗം ദൃശ്യമാണ്: 20 ൽ 15 എണ്ണം ഏപ്രിൽ വാചകത്തിൽ നിന്ന് പൂർണ്ണമായും ശരിയായിരുന്നു. മൂന്നെണ്ണം "നിലവിലെ ഹാൻഡ്‌ബുക്കിൽ ഇല്ല" എന്ന് ശരിയായി പറഞ്ഞു (മെഡിക്കൽ-അടുത്തുള്ളതും നിയമപരമായ-അടുത്തുള്ളതുമായ ഇനങ്ങൾ, പ്ലസ് വൺ ബില്ലിംഗ് തർക്കം), അതിനാൽ 20 ൽ 18 എണ്ണം സ്വീകാര്യമായിരുന്നു. രണ്ടെണ്ണം ഇപ്പോഴും പരാജയപ്പെട്ടു: ഒന്ന് 2023 PDF-നടുത്ത് മിസ് ചെയ്തു, മറ്റൊന്ന് പാസേജിൽ ഇല്ലാത്ത ഒരു ജോയിനിംഗ്-ഫീസ് കണക്ക് കണ്ടുപിടിച്ചു. ഡ്രാഫ്റ്റ് ചെയ്യാനുള്ള ശരാശരി സമയം ഇപ്പോഴും ഏകദേശം 1 മിനിറ്റായിരുന്നു.

അതേ 20, പ്രിയ സിമുലേറ്റഡ് അയയ്ക്കുന്നതിന് മുമ്പ് പരാമർശിച്ച വിഭാഗം തുറക്കുന്നത്: 20 ൽ 19 സ്വീകാര്യമായിരുന്നു. അവൾക്ക് മിക്കവാറും നഷ്ടപ്പെട്ട PDF മനസ്സിലായി. ബാക്കിയുള്ള തെറ്റ് അവലോകകൻ ഒഴുക്കോടെ ഒരു ഖണ്ഡിക വായിക്കുകയും കണ്ടുപിടിച്ച ചേരൽ ഫീസ് കണക്ക് ശ്രദ്ധിക്കാതിരിക്കുകയും ചെയ്തു. അവലോകനം ഉൾപ്പെടെ ശരാശരി സമയം 3 മിനിറ്റായിരുന്നു.

പഴയ പ്രക്രിയ, ഹാൻഡ്‌ബുക്ക് തിരയൽ മാത്രം, കോപൈലറ്റ് ഇല്ല: 20 ൽ 20 എണ്ണം സ്വീകാര്യമാണ്. ശരാശരി 9 മിനിറ്റ്.

ഈ സാമ്പിളിലുടനീളം, ലൂപ്പ് ചെയ്ത കോപൈലറ്റ് ഹാൻഡ്‌ബുക്ക് ഹണ്ടിനേക്കാൾ 6 മിനിറ്റ് വേഗതയുള്ളതായിരുന്നു (9 മൈനസ് 3), അല്ലെങ്കിൽ 20 ചോദ്യങ്ങളിലായി 120 മിനിറ്റ്, 20 ൽ 20 ന് പകരം 20 ൽ 19 എണ്ണം സ്വീകാര്യമായിരുന്നു. അൺചെക്ക് ചെയ്ത കോപൈലറ്റ് 8 മിനിറ്റ് വേഗതയുള്ളതായിരുന്നു (9 മൈനസ് 1) കൂടാതെ 20 ൽ 9 ന് തെറ്റായി, നിശബ്ദമായോ ഉച്ചത്തിലോ ആയിരുന്നു. നിങ്ങൾ സ്റ്റിയറിംഗ് പാക്കിൽ ഇടുന്നത് 67% സമയം ലാഭിക്കുന്നില്ല. ഇത് നിങ്ങൾ ഓട്ടോമേറ്റ് ചെയ്യുമായിരുന്ന 9-മിസ്സ് ലീക്കാണ്.

രണ്ട് ചോദ്യങ്ങളുടെയും തിടുക്കത്തിലുള്ള ബോസ് പതിപ്പുകൾ രണ്ടും ആവർത്തിച്ചു. സംശയാസ്പദമായ പതിപ്പുകൾ മറച്ചുവച്ചു. അതേ മോഡൽ, അതേ ഹാൻഡ്‌ബുക്ക്, വ്യത്യസ്ത വേഷവിധാനം. പ്രിയ അത് ഒരു വ്യക്തിത്വമായിട്ടല്ല, മറിച്ച് ഒരു കണ്ടെത്തലായി രേഖപ്പെടുത്തി.

പ്രസ്താവിച്ച ടെസ്റ്റ്, ഒരു ചെറിയ സെറ്റ്, കോപാകുലനായ അംഗത്തേക്കാൾ എളുപ്പമുള്ള ടിക്കറ്റുകൾ, പുസ്തകം ഇതിനകം അറിയാവുന്ന ഒരു അവലോകകൻ എന്നിവയെ അടിസ്ഥാനമാക്കിയുള്ള ഒരു ഉദാഹരണ കണക്കാണ് ഈ കണക്കുകൾ. കോപൈലറ്റ് "95% വിശ്വസനീയ"മാണെന്നോ ഹാർബർ ഒരു ഡെസ്ക് വ്യക്തിയെ വെട്ടിക്കുറയ്ക്കണമെന്നോ അവ കാണിക്കുന്നില്ല. പ്രവർത്തനസമയം പ്രശ്നമല്ലെന്നും പരിശോധനയായിരുന്നു പ്രശ്നമെന്നും അവ കാണിക്കുന്നു.

എന്ത് തെറ്റ് സംഭവിക്കാം?

  • നേതൃത്വം ഒരു മിനിറ്റ് ഡ്രാഫ്റ്റ് സമയം ഉദ്ധരിക്കുകയും 9 തവണ തെറ്റിയത് ഒഴിവാക്കുകയും ചെയ്യുന്നു. വൈകുന്നേരം 4 മണിയായിട്ടും വേഗത ഇപ്പോഴും കഴിവിന്റെ കാര്യമാണെന്ന് തോന്നുന്നു.

  • 2023 PDF സൂചികയിൽ തന്നെ തുടരുന്നു. വീണ്ടെടുക്കൽ അത് വീണ്ടും വീണ്ടും നേടിയെടുക്കുന്നു. ഗ്രൗണ്ടിംഗ് വളർന്നതായി തോന്നുന്നു, ഇപ്പോഴും അത് ഏതാണ്ട് നഷ്ടമായിരിക്കുന്നു.

  • തിരിച്ചെടുത്ത ചങ്ക് ഒരു തിളങ്ങുന്ന സെൻഡ് ബട്ടണിന് പിന്നിൽ UI മറയ്ക്കുന്നു. ആളുകൾ ഹാൻഡ്‌ബുക്ക് തുറക്കുന്നത് നിർത്തുന്നു, അങ്ങനെയാണ് ഫ്രീസ് ഉത്തരം ഒരു അംഗത്തിലേക്ക് എത്തുന്നത്.

  • സ്ലൈഡിൽ മനോഹരമായി കാണപ്പെടുന്നതിനാൽ പ്രിയ എട്ട് എളുപ്പ ചോദ്യങ്ങൾക്ക് മാത്രമേ സ്കോർ ചെയ്യുന്നുള്ളൂ. വിലയിരുത്തൽ തിയേറ്റർ, ഒരു സ്പ്രെഡ്ഷീറ്റ് മാത്രം ഉപയോഗിച്ച്.

  • "ഈ പരിശീലനം സുരക്ഷിതമാണോ" എന്ന മെഡിക്കൽ ചോദ്യത്തിന് ഉത്തരം ഒരു ലഘുലേഖ പോലെ തോന്നാം. മാപ്പിൽ ഒരിക്കലും ഇല്ല എന്ന് പറഞ്ഞിരുന്നു. മുന്നോട്ട് പോകൂ എന്നായിരുന്നു സ്വരത്തിൽ.

  • "അത് അധികമായി തോന്നിയതിനാൽ" ലോഗുകൾ ഓഫാണ്. ഒരു തവണ നഷ്ടപ്പെട്ടാൽ, ഏത് ഭാഗം വീണ്ടെടുത്തുവെന്ന് ആർക്കും കാണാൻ കഴിയില്ല.

  • അത് ഉറപ്പാണോ എന്ന് അവർ മോഡലിനോട് ചോദിക്കുന്നു. ഉറപ്പാണ്. അത് ഒരിക്കലും ഒരു പരീക്ഷണമായിരുന്നില്ല.

പ്രായോഗിക ഉപദേശം

വിശ്വാസ്യത എന്നത് ഹാർബർ വാങ്ങിയ കോപൈലറ്റിന്റെ ഒരു സവിശേഷതയല്ല. 20 ചോദ്യങ്ങൾ, നിലവിലുള്ള ഒരു ഹാൻഡ്‌ബുക്ക്, ദൃശ്യമായ ഒരു ഭാഗം, പണം ഉൾപ്പെട്ടിരിക്കുമ്പോൾ ഉറവിടം ഇപ്പോഴും തുറക്കുന്ന ഒരു വ്യക്തി എന്നിവ ഇതിന്റെ സവിശേഷതയാണ്. ഫ്ലുവൻസി അപ്‌ടൈം ടെസ്റ്റിൽ വിജയിച്ചുകൊണ്ടിരിക്കും. പോളിസി ടെസ്റ്റിൽ വിജയിക്കുന്ന ഒരേയൊരു കാര്യം ലൂപ്പ് മാത്രമാണ്.

പതിവുചോദ്യങ്ങൾ

ജനറേറ്റീവ് AI-ക്ക് വിശ്വസനീയം എന്നാൽ എന്താണ് അർത്ഥമാക്കുന്നത്?

ദൈനംദിന വിശ്വാസ്യത എന്നാൽ നിങ്ങൾക്ക് എന്തെങ്കിലും ആശ്രയിക്കാൻ കഴിയും എന്നാണ്. സംസാരിക്കുന്ന ഓട്ടോമേഷൻ ഉപയോഗിച്ച്, ഒരു കൂട്ടം പ്രോപ്പർട്ടികൾ ഒരു വാക്കിൽ ഒളിഞ്ഞിരിക്കുന്നു: വസ്തുത, സ്ഥിരത, കാലിബ്രേഷൻ, സുരക്ഷ, പ്രവർത്തന സമയം, വേഗത്തിലുള്ള സംവേദനക്ഷമത, എഡ്ജ് കേസുകൾ, വിതരണ മാറ്റത്തിന് ശേഷമുള്ള പെരുമാറ്റം. ഇവയൊന്നും ഒരുമിച്ച് പരാജയപ്പെടുന്നു. ലൈവ് ടെസ്റ്റ് എന്ത്, ആർക്ക്, ഏത് ലൂപ്പ് ഉപയോഗിച്ച് അതിനെ ചുറ്റിപ്പറ്റിയാണ് വിശ്വസനീയം. അല്ലെങ്കിൽ, നികുതി ചുമത്താൻ കഴിയുമോ എന്നതിനെ അടിസ്ഥാനമാക്കി നിങ്ങൾ ഒരു ബ്ലെൻഡറിനെ ഗ്രേഡ് ചെയ്യുകയാണ്.

AI വിശ്വസനീയമാണോ?

ഒരു സ്വഭാവ സവിശേഷത എന്ന നിലയിലല്ല. ഒരു എൽ‌എൽ‌എം ഒരു ജോലിയിൽ ഉറച്ചുനിൽക്കുകയും അടുത്ത ജോലിയിൽ നിശബ്ദമായി അഴിച്ചുമാറ്റുകയും ചെയ്യാം, ചിലപ്പോൾ ഒരേ ഇരിപ്പിൽ, ചിലപ്പോൾ നിങ്ങൾ ഒരു കോമ നീക്കിയതിനാൽ. വിശ്വാസ്യത എന്നത് ഒരു ടാസ്‌ക്കിന്റെ, ഒരു ഡാറ്റാസെറ്റിന്റെ, ഒരു വീണ്ടെടുക്കൽ ലൂപ്പിന്റെ, ഒരു ഡെമോ അല്ലാത്ത ഒരു വിലയിരുത്തലിന്റെ, ഇപ്പോഴും അത് അർത്ഥമാക്കേണ്ട ഒരു മനുഷ്യന്റെ ഒരു സ്വത്താണ്. ഒരു മിസ്സ് വിലകുറഞ്ഞതോ പിടിക്കാവുന്നതോ ആയിടത്ത് അത് ഉപയോഗിക്കുക. ഒരു മിസ്സ് ചെലവേറിയിടത്ത് വേഗത കുറയ്ക്കുക.

AI പ്രവർത്തനസമയം സത്യസന്ധതയ്ക്ക് തുല്യമാണോ?

ഇല്ല. അന്തിമ പോയിന്റ് ഉത്തരം നൽകിയോ ഇല്ലയോ എന്നതാണ് പ്രവർത്തനസമയം. ഉത്തരം അങ്ങനെയായിരുന്നോ ഇല്ലയോ എന്നതാണ് സത്യസന്ധത. ഒരിക്കലും മിന്നിമറയാത്ത ഒരു സേവനം നിങ്ങൾക്ക് ലഭിക്കും, എന്നിട്ടും ഒരു ഉപഭോക്തൃ ടിക്കറ്റിലേക്ക് ഒരു ഒഴുക്കുള്ള നുണ അയയ്ക്കാം. ക്യൂ ഒരു ഭീകരനായിരിക്കുമ്പോൾ വേഗത കഴിവായി തോന്നുന്നു. സുരക്ഷ മറ്റൊരു അച്ചുതണ്ടാണ്: ജയിൽ ബ്രേക്ക് നിരസിക്കുന്ന ഒരു ബ്രാൻഡ് ഇപ്പോഴും നിങ്ങളുടെ സ്വന്തം കുറിപ്പുകളുടെ സംഗ്രഹം മായ്ച്ചുകളഞ്ഞേക്കാം.

തെറ്റാണെങ്കിൽ പോലും ഒഴുക്കോടെ സംസാരിക്കുന്ന AI വിശ്വസനീയമായി തോന്നുന്നത് എന്തുകൊണ്ട്?

കൃത്യതയും ഒഴുക്കും വേർപിരിഞ്ഞു, ഒഴുക്ക് ആ വീട് നിലനിർത്തി. ഒരു എൽ‌എൽ‌എം നിങ്ങൾക്ക് താളം, സംരക്ഷണം, ഒരുപക്ഷേ വ്യാജമായ, പക്ഷേ മനോഹരമായ ഒരു ഉദ്ധരണി രൂപം നൽകും, നിങ്ങളുടെ തലച്ചോറ് "ഈ വ്യക്തിക്ക് അറിയാം" എന്ന് വായിക്കും. കാലിബ്രേഷൻ പലപ്പോഴും ഭയങ്കരമാണ്: ഉയർന്ന ആത്മവിശ്വാസം, മധ്യസ്ഥ സത്യം, ഒരു പ്രധാന പ്രഭാഷണം പോലെ അവതരിപ്പിക്കുന്നു. ഒരു വിചിത്രമായ തെറ്റായ ഉത്തരം നിങ്ങളെ സംശയാസ്പദമാക്കുന്നു. ഒഴുക്കുള്ള തെറ്റായ ഉത്തരം നിങ്ങളെ പരിശോധിക്കുന്നത് നിർത്താൻ പ്രേരിപ്പിക്കുന്നു. അത് ഒരു ബ്രീഫ് പോലെ സംസാരിക്കുകയാണെങ്കിൽ, ഞങ്ങൾ അതിനെ ഒരു ബ്രീഫ് പോലെയാണ് പരിഗണിക്കുന്നത്, അങ്ങനെയാണ് മിസ് ഡെക്കിലേക്ക് എത്തുന്നത്.

മെഡിക്കൽ, നിയമ, അല്ലെങ്കിൽ ഉപഭോക്തൃ പിന്തുണാ ജോലികൾക്ക് AI വിശ്വസനീയമാണോ?

അത് ബ്രാൻഡിനെ ആശ്രയിച്ചിരിക്കുന്നില്ല, ജോലിയെ ആശ്രയിച്ചിരിക്കുന്നു. ഒരു ഉൽപ്പന്നമെന്ന നിലയിൽ വൈദ്യശാസ്ത്രപരവും നിയമപരവുമായ ഉപദേശം ഒരിക്കലും മതിയാകില്ല: മോഡൽ ഒരു സ്റ്റബ് ആണ്, മനുഷ്യൻ പ്രൊഫഷണലാണ്. ഉപഭോക്തൃ പിന്തുണയ്ക്ക് ഒരു കർശനമായ നയത്തിനുള്ളിൽ ഡ്രാഫ്റ്റ് ചെയ്യാൻ കഴിയും, പക്ഷേ ഒരു വ്യക്തിക്ക് പണവും വിശ്വാസവും അയയ്ക്കണം, കാരണം കണ്ടുപിടിച്ച നയവും മാന്യമായ തെറ്റ് ഇല്ല എന്നതും സാധാരണ പരാജയമാണ്. ഡ്രാഫ്റ്റുകളും സംഗ്രഹങ്ങളും നിങ്ങൾക്ക് ഇതിനകം അറിയാവുന്ന വാചകത്തിന്റെ ആദ്യ പാസാണ്. പേരുകൾ, നമ്പറുകൾ, വേദനിപ്പിക്കുന്ന വരി എന്നിവ പരിശോധിക്കുക.

എന്തുകൊണ്ടാണ് AI ഭ്രമാത്മകമാകുന്നത്, വ്യതിചലിക്കുന്നത്, അല്ലെങ്കിൽ നിശബ്ദമായി തെറ്റായി മാറുന്നത്?

ഭ്രമാത്മകതയാണ് ഏറ്റവും വലിയ നഷ്ടം: നിലവിലില്ലാത്ത ഒരു പുസ്തകം, ഒരിക്കലും അയയ്ക്കാത്ത ഒരു ചടങ്ങ്, ഔദ്യോഗികമായി തോന്നുന്ന ഒരു സംഖ്യയുള്ള ഒരു നയ വ്യവസ്ഥ. ഡ്രിഫ്റ്റ് അത്ര സിനിമാറ്റിക് അല്ല: ലോകം നീങ്ങുന്നു, മോഡലിന്റെ അവശിഷ്ടങ്ങൾ നിലനിൽക്കുന്നു, മുൻകാല കാലാവസ്ഥയിൽ നിന്ന് നിങ്ങൾക്ക് നന്നായി ചിട്ടപ്പെടുത്തിയ ഉത്തരം ലഭിക്കും. നിശബ്ദമായ തെറ്റ് എന്നത് ഒഴിവാക്കലിനെ ഒഴിവാക്കുന്ന ഒരു സംഗ്രഹമാണ്. അല്ലെങ്കിൽ ഒരുപക്ഷേ ഒരു നിർബന്ധമാക്കി മാറ്റുന്ന ഒരു പാരാഫ്രേസ് ആണ്. അർത്ഥം നഷ്ടപ്പെട്ടിരിക്കുമ്പോൾ വസ്തുത സാങ്കേതികമായി മികച്ചതായി കാണപ്പെടും. നിങ്ങൾ പാക്കേജ് മാറ്റുമ്പോൾ പെട്ടെന്നുള്ള സംവേദനക്ഷമത വസ്തുതകളെ തിളക്കമുള്ളതാക്കുന്നു.

ഗ്രൗണ്ടിംഗ് അല്ലെങ്കിൽ വീണ്ടെടുക്കൽ AI-യെ വിശ്വസനീയമാക്കുമോ?

ഗ്രൗണ്ടിംഗ് എന്നാൽ മൂടൽമഞ്ഞിൽ നിന്നുള്ള ഉത്തരമല്ല, ഇതിൽ നിന്നുള്ള ഉത്തരമാണ്. വീണ്ടെടുക്കൽ വർത്തമാനത്തെ ഒരു പരിശീലനം ലഭിച്ച കൂമ്പാരത്തിലേക്ക് ഉറപ്പിക്കുന്നു. അത് പരാജയപ്പെടുമ്പോൾ, അത് മാന്യമായി പരാജയപ്പെടുന്നു: ഒരു ഏതാണ്ട് മിസ് ഡോക്യുമെന്റ്, ഒരു രചിച്ച എഴുത്ത്, നിങ്ങളുടെ ചെക്കിംഗ് ഇൻസ്റ്റിങ്ക്റ്റ് ക്ലോക്കുകൾ പ്രവർത്തിക്കുന്നു. ഗ്രൗണ്ടിംഗ് ഒരു ഫ്ലോറാണ്, ഒരു ഹാലോ അല്ല. വീണ്ടെടുക്കപ്പെട്ട ചങ്ക് പരിശോധിക്കാൻ നിങ്ങൾക്ക് കഴിയുന്നില്ലെങ്കിൽ, മികച്ച ലൈറ്റിംഗ് ഉള്ളതിനാൽ നിങ്ങൾ ഇപ്പോഴും മൂടൽമഞ്ഞിലാണ്. വിലകൾ അല്ലെങ്കിൽ നയരൂപീകരണം പോലുള്ള ലൈവ്-സ്റ്റേറ്റ് ടാസ്‌ക്കുകൾ സ്ഥിരതയുള്ള ക്രാഫ്റ്റുമായി കലർത്തുക, ഇതിനകം നീങ്ങിയ ഒരു ലോകത്തെക്കുറിച്ച് നിങ്ങൾക്ക് വളരെ ഉറപ്പുള്ള ഉത്തരം ലഭിക്കും.

ഒരു ഡെമോ AI വിശ്വാസ്യതയുടെ മോശം പരീക്ഷണമായിരിക്കുന്നത് എന്തുകൊണ്ട്?

ഒരു ക്ലീൻ പ്രോംപ്റ്റും ആയിരം കസിൻസ് മോഡൽ കണ്ട ഒരു ടാസ്‌കും മൂർച്ചയുള്ളതായി കാണപ്പെടും. ലൈവ് വർക്ക്ഫ്ലോകളിൽ കുടുങ്ങിയ പേസ്റ്റും, നഷ്ടപ്പെട്ട ഫയലുകളും, ഉത്കണ്ഠ കുറയ്ക്കുന്ന ആദ്യ ഉത്തരം സ്വീകരിക്കുന്ന ഒരു ഉപയോക്താവും ഉണ്ട്. ലീഡർബോർഡ് സ്കോർ നിങ്ങളുടെ ടിക്കറ്റുകളിലെ കാലിബ്രേഷൻ അല്ല. മോഡൽ റിസ്ക് എന്നത് വോളിയത്തിൽ ഇത് തെറ്റാകുമ്പോൾ സംഭവിക്കുന്നതാണ്, അത് ഒരു ട്രിവിയ സെറ്റ് പാസായോ ഇല്ലയോ എന്നതല്ല. നിങ്ങൾക്ക് ആവശ്യമുള്ള പരിശോധനകൾ വരണ്ടതാണ്: വീണ്ടെടുത്ത ഭാഗത്തിനുള്ളിൽ തുടരുക, ബ്ലഫിംഗിന് പകരം അനിശ്ചിതത്വം ഫ്ലാഗ് ചെയ്യുക, നിങ്ങൾ വീണ്ടും എഴുതുമ്പോൾ സ്ഥിരത പുലർത്തുക, കണ്ടുപിടുത്തത്തിന് പകരം അടച്ചുപൂട്ടൽ പരാജയപ്പെടുക.

ആരും ബന്ധത്തിലല്ലെങ്കിൽ AI വിശ്വസനീയമാണോ?

ഇല്ല. ആരും ഉത്തരവാദികളല്ലെങ്കിൽ, സിസ്റ്റം അത് പോലെ തന്നെ ഉപയോഗിക്കും. പരാജയ മോഡുകളുമായി പൊരുത്തപ്പെടുന്ന ഒരേയൊരു ഡിസൈൻ ഹ്യൂമൻ-ഇൻ-ദി-ലൂപ്പ് ആണ്: ആർക്കാണ് അവലോകനം ചെയ്യാൻ കഴിയുക, ആർക്കാണ് ഇത് നിർത്താൻ കഴിയുക, എന്താണ് ലോഗിൻ ചെയ്യുന്നത്, ഒരു മിസ്സിനുശേഷം എന്ത് സംഭവിക്കും. ഉത്തരം "മോഡൽ" ആണെങ്കിൽ, നിങ്ങൾക്ക് ഉത്തരമില്ല. സംഭവത്തിന് ശേഷം മോഡലുകൾ മീറ്റിംഗിൽ പോകില്ല. വൈദ്യശാസ്ത്രം, നിയമം, ക്രെഡിറ്റ് അല്ലെങ്കിൽ സുരക്ഷാ-നിർണ്ണായക പ്രവർത്തനങ്ങൾക്ക്, മനുഷ്യൻ ലൂപ്പാണ്, മോഡൽ ഒരു സ്റ്റബ് ആണ്.

തെറ്റുകൾ കണ്ടെത്തുന്നതിനായി ഞാൻ എങ്ങനെയാണ് AI-യെ പ്രോംപ്റ്റ് ചെയ്യേണ്ടത്?

"ഇതിനെ എന്ത് തെറ്റാക്കും?" എന്നതിനെ "ആത്മവിശ്വാസം ഉണ്ടാക്കുക" എന്ന് മനഃപൂർവ്വം അനിശ്ചിതത്വം ആവശ്യപ്പെടുക. കഴിയുമ്പോൾ തലമുറകളിൽ നിന്ന് വീണ്ടെടുക്കൽ വിഭജിക്കുക. ആദ്യം ഭാഗങ്ങൾ നോക്കുക, തുടർന്ന് എഴുത്ത് ആവശ്യപ്പെടുക. വസ്ത്രധാരണം മാറ്റുക: പുനഃക്രമീകരിക്കുക, അല്ലെങ്കിൽ വിപരീതമായി വാദിക്കാൻ ആവശ്യപ്പെടുക. "ഞാൻ ഒട്ടിച്ച വാചകത്തിൽ നിന്ന് മാത്രം" അല്ലെങ്കിൽ "കാണാതായാൽ, കാണാതായെന്ന് പറയുക" എന്നിങ്ങനെയുള്ള നിയന്ത്രണങ്ങൾ നിർബന്ധിച്ച് പരിശോധിക്കുക. ഒരു വെരിഫയർ ഉള്ള ജോലികൾക്ക് മുൻഗണന നൽകുക, കൂടുതൽ പ്രത്യേകതകൾ ശ്രദ്ധിക്കുക, കാരണം അവിടെയാണ് ഭ്രമാത്മകത വസ്ത്രം ധരിക്കാൻ ഇഷ്ടപ്പെടുന്നത്.

അവലംബം

  1. എൻഐഎസ്ടി - nvlpubs.nist.gov

  2. എൻഐഎസ്ടി - airc.nist.gov

  3. എൻഐഎസ്ടി - airc.nist.gov

  4. ഐസിഒ - ico.org.uk

  5. എൻ‌സി‌എസ്‌സി - www.ncsc.gov.uk

  6. എൻ‌സി‌എസ്‌സി - www.ncsc.gov.uk

  7. OWASP - genai.owasp.org

ഔദ്യോഗിക AI അസിസ്റ്റന്റ് സ്റ്റോറിൽ ഏറ്റവും പുതിയ AI കണ്ടെത്തുക

ഞങ്ങളേക്കുറിച്ച്

ക്വിസ്
1. ലേഖനം അനുസരിച്ച്, ഒരു സ്വഭാവമെന്ന നിലയിൽ AI വിശ്വസനീയമാണോ?

2. പ്രവർത്തന സമയവും സത്യസന്ധതയും തമ്മിലുള്ള വ്യത്യാസം എന്താണ്?

3. തെറ്റായ, ഒഴുക്കുള്ള ഉത്തരം വിചിത്രമായ ഉത്തരത്തേക്കാൾ അപകടകരമാകുന്നത് എന്തുകൊണ്ട്?

4. ചിത്രീകരണ ഹാർബർ മെമ്പർഷിപ്പ് 20 ചോദ്യങ്ങളുള്ള പരീക്ഷയിൽ, ചെക്ക് ചെയ്യാത്ത കോപൈലറ്റിന് എന്ത് സംഭവിച്ചു?

5. ലേഖനം അനുസരിച്ച്, പരിശോധിക്കാവുന്ന ഒരു വീണ്ടെടുക്കൽ ചങ്ക് ഇല്ലാതെ ഗ്രൗണ്ടിംഗ് എന്താണ്?


ബ്ലോഗിലേക്ക് മടങ്ങുക