Кароткі адказ: штучны інтэлект ненадзейны як рыса: ён залежыць ад задачы, цыкла пошуку і чалавека, які ўсё яшчэ знаходзіцца на кручку. Час бесперабойнай працы — гэта тое, ці адказала канцавая кропка; праўдзівасць — гэта тое, ці быў адказ такім. Выкарыстоўвайце яго, калі промах танны або яго можна выкрыць; запавольвайце працу, калі промах дарагі.
Асноўныя высновы:
Падсправаздачнасць: назавіце, хто праводзіць праверку, хто можа спыніць гэта і хто адказны.
Празрыстасць: Праверце атрыманы фрагмент, інакш вы ўсё яшчэ ў тумане.
Аўдытабельнасць: фіксуе запыты, атрыманыя фрагменты і адпраўкі, каб можна было адсачыць прамахі.
Супраціў злоўжыванням: закрывайце пытанні аб грашах; ніколі не выдумляйце лічбы, вокны ці палітыку.
Ілюстрацыйныя вынікі: разглядайце ілюстрацыйны тэст з 20 пытанняў як карту, а не як 95% доказ.

Артыкулы, якія вам могуць спадабацца пасля гэтага:
🔗 Як выкарыстоўваць штучны інтэлект у паўсядзённым жыцці
Адкрыйце для сябе практычныя спосабы, як штучны інтэлект можа спрасціць паўсядзённыя задачы і руціну.
🔗 Як выкарыстоўваць штучны інтэлект на працы
Даведайцеся пра практычныя спосабы павышэння прадукцыйнасці і эфектыўнасці з дапамогай штучнага інтэлекту.
🔗 Ці можа штучны інтэлект думаць самастойна?
Даследуйце, ці сапраўды штучны інтэлект можа думаць самастойна і разважаць.
🔗 Якія існуюць тыпы штучнага інтэлекту?
Зразумейце асноўныя тыпы, магчымасці і ключавыя адрозненні штучнага інтэлекту.
Што азначае «надзейны», калі машына — гэта статыстычны папугай
Надзейнасць у паўсядзённай мове азначае, што можна на штосьці абаперціся.
З аўтаматызацыяй, якая гаворыць, пад адным словам хаваецца цэлы шэраг розных уласцівасцей. Фактычнасць. Паслядоўнасць. Каліброўка - ці адпавядае ўпэўненасць мадэлі верагоднасці яе правільнасці, ці яна проста... гучыць упэўнена. Бяспека. Час бесперабойнай працы. Хуткая адчувальнасць. Паводзіны ў памежных выпадках. Паводзіны пасля змены размеркавання, калі рэальны свет не з'яўляецца светам навучання. Нішто з гэтага не дае збою разам. Гэта тое, што людзі прапускаюць.
Чат-бот можа быць «на месцы» ўвесь тыдзень і ўсё роўна памыляцца ў аўторак пасля абеду. Другі праграміст можа добра працаваць на пачатковым этапе, а потым галюцынаваць API, які выглядае дакладна як сапраўдны. Метафара, да якой людзі імкнуцца, — гэта «малодшы калега». Яна недасканалая — малодшыя калегі саромеюцца, — але яна бліжэй да «аракула».
Тэст у рэжыме рэальнага часу надзейны для чаго, для каго, з дапамогай цыкла "які". Інакш вы ацэньваеце блендер па тым, ці можа ён апрацоўваць падаткі.
Працоўная праца — гэта не праўдзівасць — два розныя віды «надзейнасці»
Аператыўныя спецыялісты і праўдзівыя спецыялісты выкарыстоўваюць адно і тое ж слова і абмяркоўваюць яго.
Працоўны час — гэта «ці адказала канцавая кропка». Праўдзівасць — гэта «ці быў адказ такім». Кіраванне клапоціцца пра абодва, а рызыка мадэлі знаходзіцца ў непрыгожай прагаліне. Вы можаце мець сэрвіс, які ніколі не міргае, і ўсё роўна адпраўляць у заяўку кліента плыўную хлусню. Надзейны ў сэнсе SRE. Ненадзейны ў сэнсе «калі ласка, не выдумляйце палітыку вяртання грошай».
Думаю, гэта і так відавочна, калі напісаць. Але ў 16:00, калі адказ хуткі, а чарга — проста монстр, гэта ўжо не так. Хуткасць адчуваецца як кампетэнтнасць. Раней павольнасць азначала, што хтосьці думае. Цяпер хуткасць — гэта сігнал таго, што ніхто не думае.
Бяспека — гэта яшчэ адна вось. Мадэль, якая адмаўляецца ад непрыемнага джейлбрэйку, з'яўляецца «надзейнай» з пункту гледжання бяспекі і ўсё роўна можа скажаць рэзюмэ вашых уласных нататак.
Беглае і няправільнае горшае за нязграбнае і прамалінейнае
Гэта праблема ўпэўненасці ў сабе, і менавіта яна грызе.
Дакладнасць і бегласць разышліся, і бегласць трымала дом у руцэ. Ступень магістра права (LLM) надасць вам рытм, падстрахуючыся ў патрэбных месцах, магчыма, фальшывую, але прыгожую форму цытаты. Ваш мозг чытае: «гэты чалавек ведае». Але гэта не чалавек, і каліброўка часта жахлівая — высокая ўпэўненасць, паўтаральная праўда, прамоўленая як асноўная даклада.
Нязграбны няправільны адказ выклікае падазрэнні. Беглы няправільны адказ прымушае вас перастаць правяраць. Гэта не маленькая розніца; гэта ўся гісторыя ў адным крыху непрыемным сказе.
Тут таксама прысутнічае прадузятасць, не заўсёды як абраза, хутчэй як меркаванне па змаўчанні пра тое, хто знаходзіцца ў пакоі і які адценне англійскай мовы лічыцца нейтральным. Людзей падманваюць, таму што мова — гэта наш найстарэйшы інтэрфейс даверу. Калі яна напісана як кароткі змест, мы ставімся да яе як да кароткіх звестак. Я ўвесь час збіраюся быць больш цынічным у гэтым пытанні. Потым я чытаю празрысты кароткі змест, і мае плечы апускаюцца. Калі я ўваходжу на сустрэчу, кароткі змест выглядае скончаным. Гэтае сказанне робіць занадта шмат працы, і ўсё роўна: менавіта так промах трапляе ў калоду.
Надзейнасць залежыць ад сітуацыі, а не ад брэнда
Брэнды адцягваюць увагу. Параўнанне, якое зарабляе на жыццё, — гэта праца. Радкі будуць спрачацца адзін з адным. Гэта нармальна.
| Выпадак выкарыстання | Як гэта мае тэндэнцыю церпяць няўдачу | Калі гэта «дастаткова добра» | Што чалавеку яшчэ трэба зрабіць | Чаму людзей падманваюць |
|---|---|---|---|---|
| Падрыхтоўка / рэзюмэ | Выдаляе выключэнне; пераўтварае maybe у must | Першы праход па тэксце, які вы ўжо ведаеце | Праверце імёны, нумары, лінію, якая можа пашкодзіць | Падобна на цябе. Адправіць. |
| Пытанні і адказы ў стылі пошуку | Туманныя адказы; амаль няўдалае аднаўленне апісана як факт | Арыентацыя — не апошняе слова | Адкрыйце крыніцу, інакш у вас ёсць толькі здагадка | Той жа тон для здабытага і вынайдзенага |
| Дапамога з кодам | Вынайдзеныя API; тэсты, якія пацвярджаюць памылку | Шаблон, клей, "растлумачце гэтую памылку" | Запусціце гэта. Прачытайце розніцу. (Прабачце, гэта прапаведніцкі радок.) | Хатні стыль. Экалагічна чыстыя тэсты. |
| Падтрымка кліентаў | Вынайдзеная палітыка; ветлівае няправільнае «не» | Чарнавікі ў рамках жорсткай палітыкі | Валодайце адпраўкай грошай і давярайце | Хутка + добразычліва. Ніхто не правярае пятае паведамленне. |
| Медыцынская / юрыдычная кансультацыя | Бегла, структуравана, катастрафічна ўпэўнена | Амаль ніколі як прадукт | Будзьце прафесіяналам. Мадэль — гэта проста загаловак. Калі гэта гучыць жорстка, то добра. | Гаворыць як коратка. |
| Ацэнка / рэйтынг | Праксі-функцыі; дрэйф; выпадкі апушчаных краёў | Трыяж, які вы адменіце | Выбарка па хвосте | Лічбы здаюцца дарослымі. Панэлі кіравання падобныя на кіраванне. Самі па сабе яны такімі не з'яўляюцца. |
| Генерацыя малюнкаў | Рукі, лішнія локці, рэшткі стэрэатыпаў | Мудборды, аднаразовыя камплекты — не доказы | Паглядзіце двойчы, на сэнс не толькі артэфактаў | Прыгожая закрывае кішэнь скептыкаў |
| Аўтаномныя агенты | Упэўнены выклік інструмента; памылкі, якія пагаршаюць | Вузкія пятлі з аўтаматычным адключэннем | Трымайцеся на кручку. Закрыйце тое, да чаго ён можа дакрануцца. | Нумараваны план выглядае як кампетэнтнасць. Часта гэта спіс спраў з рухаючай сілай. |
У любым выпадку. Калі ваш любімы інструмент спрытна працуе з чарнавікамі, і вы ловіце сябе на тым, што просіце яго аб юрыдычным суцяшэнні апоўначы, гэта не паляпшэнне. Гэта карта паказвае, што вы ад яго адмовіліся.
Галюцынацыі, дрэйф і ціхі тып няправільнага
«Галюцынацыя» трапляе ў загалоўкі газет, таму што яна пікантная: кніга, якой не існуе, функцыя, якая ніколі не была выпушчана, пункт палітыкі з лічбай, якая здаецца афіцыйнай.
Дрэйф менш кінематаграфічны. Свет рухаецца. Рэшткі мадэлі застаюцца. Вы задаеце пытанне, якое патрабуе новага кантэксту, і атрымліваеце добра арганізаваны адказ з папярэдняга надвор'я. Я ледзь не напісаў «з іншай эпохі», што і перабольшанне, да якога і выклікае гэтая тэма. Гэта не іншая эпоха. Гэта проста не цяпер.
Ціхая няправільнасць — гэта тое, што мяне хвалюе больш за ўсё. Рэзюмэ, якое апускае выключэнне. Перафраз, які ператварае «магчыма» ў «абавязкова». Фактычнасць можа быць «тэхнічна добрай», у той час як сэнс страціў сваю актуальнасць.
Хуткая адчувальнасць пагаршае сітуацыю. Змяніце абгортку, і «факты» заблішчэюць. Спытайце як скептык — атрымайце агароджу. Спытайце як бос на хаду, хутка перабольшвайце. Калі ў вашай ацэнцы выкарыстоўваецца толькі адзін касцюм, яна крыху хлуслівая. Прабачце.
Джейлбрэйкі знаходзяцца на мяжы, і я не хачу фільм пра рабаванне. Калі сістэму можна ўгаварыць адмовіцца ад манер, надзейнасць — гэта не толькі праўда; гэта тое, ці з'яўляюцца агароджы пятлёй ці плакатам.
Рэшткі трэніровак, застарэлыя веды і чаму зазямленне — гэта не чароўная палачка
Генератыўныя мадэлі навучаюцца на кучы, а затым накіроўваюцца на ваш аўторак. Аднаўленне — гэта дарослая спроба прыкруціць сучаснасць да гэтай кучы. Зазямленне азначае «адказ адсюль, а не з туману». Калі гэта не атрымліваецца, то гэта не атрымліваецца ветліва.
Класічная няўдача: пошукавік знаходзіць дакумент, які ледзь не трапіў у цэль. Генератар запісвае яго з поўным спакоем. Вы бачыце аб'ект у форме крыніцы, і ваш інстынкт праверкі спрацоўвае. Я раблю гэта. Вы, напэўна, робіце гэта. Ідэя цытавання правільная; рэалізацыя настолькі добрая, наколькі добрае трапленне.
Яшчэ адна ўцечка — гэта застарэлыя веды. Некаторым задачам патрэбны жывы стан — цэны, інвентар, бягучая фармулёўка палітыкі. Некаторым патрэбны стабільны стан, напрыклад, як структураваць службовую запіску. Змяшайце ўсё гэта, і вы атрымаеце вельмі ўпэўнены адказ пра свет, які ўжо змяніўся. Зрух размеркавання — гэта дарослая назва: жывое размеркаванне — гэта не навучальнае размеркаванне, а памежныя выпадкі жывуць у прамежку.
І яшчэ адно, сказанае з няправільным працяжнікам, бо менавіта так выглядаюць мае нататкі: зазямленне — гэта падлога, а не арэол. Калі вы не можаце агледзець атрыманы фрагмент, вы ўсё яшчэ ў тумане, проста з лепшым асвятленнем.
Тэатр ацэнкі: чаму дэманстрацыя — гэта жудасны тэст
Дэманстрацыі — гэта проста асвятленне. Тэст-маркіроўкі — гэта крыху больш шчырыя вынікі, і ўсё роўна гэта не ваша задача.
Чыстая падказка і задача, мадэль бачыла тысячу сваякоў — вядома, яна выглядае выразна. Ацэнка, якая вымярае толькі гэта, вымярае сцэнічную пастаноўку. У жывых працоўных працэсах ёсць заблытаная ўстаўка, адсутныя файлы і карыстальнік, які прымае першы адказ, што зніжае яго трывожнасць.
Бенчмаркі маюць значэнне. Яны проста не так добра разносяцца, як мяркуюць калоды. Рэйтынг у табліцы лідэраў — гэта не каліброўка вашых білетаў. Рызыка мадэлі ў кампаніі — гэта «што адбудзецца, калі гэта памыляецца пры вялікай колькасці», а не «ці прайшло гэта тэставы набор». Вам патрэбныя сухія тэсты: заставайцеся ў межах знойдзенага ўрыўка; пазначайце нявызначанасць замест таго, каб блефаваць; заставайцеся паслядоўнымі пры перафразіроўцы; не зачыняйце (адмаўляйцеся, пытайцеся, адкладайце), а не адкрывайце (вынаходзьце).
Я назіраў, як людзі ўспрымалі адно ўражлівае выкананне стравы як доказ. Гэта як вырашыць, што рэстаран "надзейны", таму што закуска была прыгожай. Магчыма, так яно і ёсць. Магчыма, кухня добра папрацавала дзесяць хвілін.
Невялікая супярэчнасць: я ўсё яшчэ выкарыстоўваю дэма-версіі, каб адчуць сябе. Я проста не наймаю тых, хто адчуў.
Ці надзейны штучны інтэлект? Толькі калі хтосьці ўсё яшчэ на кручку
з улікам фактару ўзаемадзеяння паміж чалавекам і сістэмай — адзіная, якая адпавядае рэжымам адмоваў.
Калі ніхто не нясе адказнасці, сістэма будзе выкарыстоўвацца так, быццам яна існуе. Кіраванне — гэта непрыгожая назва для «хто правярае, хто можа спыніць, што рэгіструецца, што адбываецца пасля промаху». Агенты робяць гэта больш выразным, таму што яны прымаюць меры, а не проста абзацы. Чарнавік, які вы не адпраўлялі, танны. Выклік інструмента, які вы не мелі на ўвазе, не такі.
Назавіце, хто адказны. Калі адказ «мадэль», у вас няма адказу. Мадэлі не ідуць на сустрэчу пасля інцыдэнту. Ідзе чалавек, альбо пыласос, а потым адвакат.
Выберыце праверкі, якія адпавядаюць радыусу выбуху. Праверка ўзроўню арфаграфіі для паведамлення ў сацыяльных сетках. Праверка крыніц для ўсяго, што сцвярджае факт. Прафесіянал для ўсяго, што звязана з медыцынай, правам, крэдытам, крытычна важнымі для бяспекі аперацыямі. Для іх чалавек не "ў курсе". Чалавек - гэта цыкл. Мадэль - гэта заглушка. Гэта не скептыцызм як асобы. Гэта густ.
Зараз модна хаваць чэк за бліскучай кнопкай адпраўкі. У нашы дні менавіта так можна выпадкова аўтаматызаваць чутку. Апошнім часам я стаў больш сухім у гэтым пытанні, і праца стала лепшай.
Як спытаць, каб не заўважыць
Вы можаце даследаваць гэтыя сістэмы, не становячыся прафесійным скептыкам у сонечным святле.
-
Свядома пытайцеся пра нявызначанасць. «Што можа зрабіць гэта няправільным?» лепш, чым «зрабіце гэта ўпэўненым».
-
Па магчымасці аддзяліце пошук ад пакалення. Спачатку праглядзіце ўрыўкі. Затым папрасіце апісанне.
-
Змяніце касцюм. Перафразуйце. Папрасіце яго давесці адваротнае. Хуткая адчувальнасць — гэта як ліхтарык, калі выкарыстоўваць яе такім чынам.
-
Абмежаванні прымусу: «толькі з тэксту, які я ўставіў», «калі адсутнічае, сказаць, што адсутнічае». Мадэлі дзіўна паслухмяныя гэтаму... пакуль не перастануць. Усё роўна праверце.
-
Аддаю перавагу задачам з верыфікатарам. Кампілятары, лінтэры, праверкі схем, другая пара вачэй. Надзейнасць любіць ацэншчыка.
-
Звярніце ўвагу на падказку: дадатковая канкрэтнасць. Дакладная лічба, назва справы, акуратны нумараваны пункт — вось дзе галюцынацыя любіць апранацца.
-
Захоўвайце бачны чалавечы крок. Калі інтэрфейс хавае праверку, людзі яе прапускаюць. Гэта мэбля, а не маральная хіба.
Нішто з гэтага не робіць мадэль "праўдзівай". Гэта робіць цыкл менш надзейным. Што, я мяркую, і з'яўляецца прадуктам.
Дзе вас пакідае карта
Такім чынам, пытанне «так/не» працуе толькі як дзвярны праём.
Ці надзейны штучны інтэлект? Не як рыса. Як уласцівасць задачы, набору дадзеных, цыкла пошуку, ацэнкі, якая не з'яўляецца дэманстрацыяй, і чалавека, які ўсё роўна павінен мець гэта на ўвазе. Бегласць будзе працягваць падманваць нас, таму што мы — моўныя жывёлы, а гэтыя сістэмы — моўныя машыны. Працоўная праца будзе працягваць блытацца з праўдай, таму што абодва адчуваюцца так, быццам «гэта спрацавала». Другія пілоты будуць працягваць зарабляць сабе на жыццё ў заблытанай сярэдзіне — чарнавікі, рэзюмэ, якія можна праглядзець, код, які можна скампіляваць — і небяспечна, калі мы перадаем меркаванне абзацу, якому ўсё роўна.
Выкарыстоўвайце іх там, дзе промах танны або яго можна дагнаць. Знізьце хуткасць там, дзе промах дорага каштуе. Гэта прамы адказ, і ён варты больш, чым проста слоган.
Калі вы возьмеце адну рэч: перастаньце пытацца ў мадэлі, ці ўпэўненая яна. Паглядзіце, што адбудзецца, калі вы спытаеце ў яе, як яна можа памыляцца. Затым ідзіце і праверце.
Прыклад з рэальнага свету: стварэнне памочніка па пытаннях палітыкі сяброўства на базе штучнага інтэлекту
Сцэнар
Прыя кіруе аддзелам ведаў для Harbour Membership, гандлёвай арганізацыі незалежных трэнажорных залаў Вялікабрытаніі, якая складаецца з 70 чалавек. На пытанні ўдзельнікаў адказваюць тры чалавекі. Крыніцай праўды з'яўляецца 180-старонкавы даведнік, які абнаўляецца кожны квартал, а таксама старыя PDF-файлы на агульным дыску, якія ніхто не адважыцца выдаліць.
Кіраўніцтва ўжо набыло капілота службы падтрымкі. Дэманстрацыя была даволі добрай. Час бесперабойнай працы быў нармальным. На другім тыдні ў чарнавіку, які піша свабодна, удзельніку паведамляецца, што ён можа замарозіць свой уліковы запіс на 14 дзён і атрымаць поўны вяртанне грошай «як стандартна». Гэта не палітыка. Агент заўважыў гэта, таму што яны ўсё роўна адкрываюць кіраўніцтва, калі гаворка ідзе пра грошы. Пытанне кіраўніцтва, адпраўленае так, быццам гэта было так ці не, гучала так: ці надзейны штучны інтэлект?
Прыя адмаўляецца ад вердыкту. Яна ўспрымае яго як карту. Задача не ў тым, каб «даць удзельнікам аракул». Яна ў тым, каб «напісаць адказ з бягучага даведніка, паказаць урывак і паставіць адказ на пытанне, калі ўрывак адсутнічае». Калі другі пілот не можа гэтага зрабіць, то гэта чарнавіковая цацка, а не стол для палітыкі.
Што патрэбна памочніку
-
Даведнік за красавік 2026 года як адзіны дазволены корпус з захаваннем нумароў раздзелаў
-
Стары PDF-файл 2023 года наўмысна пакінуты ў дыску, каб яны маглі ўбачыць, ці атрымаецца пры пошуку амаль што недапушчальны фрагмент
-
Пісьмовае правіла: ніякіх асабістых дадзеных кліентаў у інструментах для спажыўцоў; ніякіх адпраўак без чалавека; ніякіх выдумляных нумароў, вокнаў або пунктаў «як стандарт»
-
Дазвол на рэгістрацыю запытаў, атрыманых фрагментаў і канчатковай адпраўкі
-
Імёны ўладальнік (Прыя), які будзе ацэньваць тэставы набор і спыняць другога пілота, калі ён не атрымаецца, закрыў горш, чым падкідванне манеты ў грашовых пытаннях
-
Калі інструмент падтрымлівае пошук, знойдзены фрагмент павінен быць бачны побач з чарнавіком. Калі не, секцыю ўставяць уручную. Зазямленне без прахода, які можна праверыць, усё роўна лічыцца туманам.
Прыклад інструкцыі
Прыя кажа гэта звычайнай мовай, а не ў сцэнічнай падказцы:
Адказвайце толькі па ўрыўках з дапаможніка за красавік 2026 года, якія вам далі. Пазначце нумар раздзела. Калі адказу няма ў гэтых урыўках, скажыце «няма ў бягучым дапаможніку» і спыніцеся. Не выдумляйце перыяды прыпынення дзеянняў, правілы вяртання грошай або зборы. Не абнаўляйце «на меркаванне трэнажорнай залы» да «як стандартна». Калі два ўрыўкі супярэчаць адзін аднаму, пакажыце абодва і пазначце, які з іх актуальны. Вы рыхтуеце для чалавека, які адкрые зыходны код, перш чым што-небудзь перададуць удзельніку.
Затым яна пакідае сабе другую інструкцыю, бо сэнс артыкула — цыкл, а не мадэль:
Перад адпраўкай адкрыйце цытаваны раздзел. Спытайце: «Што можа зрабіць гэта няправільна?» Калі чарнавік утрымлівае нумар, якога няма ў тэксце, адхіліце яго. Калі я спытаў, як начальнік у спешцы, спытайце яшчэ раз, як скептык, і параўнайце.
Добры чарнавік выглядае наступным чынам: «Не ў бягучым кіраўніцтве (красавік 2026 г., раздзел 4.2). Замарожванне ажыццяўляецца на меркаванне трэнажорнай залы. Вяртанне сродкаў не аўтаматычнае. Павысіць узровень». Дрэнны чарнавік выглядае наступным чынам: «Удзельнікі могуць замарозіць свой удзел на 14 дзён і атрымаць поўны вяртанне грошай як стандартнае рашэнне. Пацверджана ў кіраўніцтве». Той жа тон. Толькі адзін з іх — гэта палітыка.
Як гэта праверыць
Прыя піша 20 пытанняў, перш чым паглядзець на вынік другога пілота. Гэты парадак мае значэнне. Дэманстрацыя — гэта асвятленне. Гэта пробны тэст.
Гэта не дробязь. Гэта жывы стол:
-
Восем пытанняў, адказы на якія знаходзяцца ў адным бягучым раздзеле (лёгкія пытанні)
-
Чатыры амаль недапрацаваныя варыянты, дзе PDF-файл 2023 года больш падобны па фармулёўцы да красавіцкага тэксту
-
Тры пытанні, якія «не ўваходзяць у дапаможнік» (спрэчкі аб выстаўленні рахункаў, пытанне «ці бяспечна гэта навучанне», звязанае з медыцынскімі аспектамі, і пытанне аб карэкціроўцы кантракту, звязанае з юрыдычнымі аспектамі)
-
Тры фінансавыя пытанні (замарозка, вяртанне сродкаў, уступны ўзнос)
-
Два звычайныя пытанні для ўдзельнікаў (гадзіны працы, страхоўка трэнера)
Два з гэтых дваццаці пытанняў былі перапытаныя ў другім касцюме, адзін раз у ролі паспешлівага начальніка і адзін раз у ролі скептыка, у рамках праверкі на адчувальнасць да падказак. Гэтыя паўторныя пытанні былі запісаны ў журнал, а не ўключаны ў 20-бальную ацэнку.
Рубрыка, ацэненая Прыяй з адкрытым дапаможнікам: для праходу патрэбна правільнае бягучае правіла, рэальны нумар раздзела і ніякага лішняга выдуманага сказа. Ціхі правал — гэта тэхнічна вытанчаны сказ, які адкінуў выключэнне або ператварыў «магчыма» ў «абавязкова». Адкрыты правал — гэта выдуманы нумар або PDF-файл з амаль няўдачай, які лічыцца бягучым. Час бесперабойнай працы ўлічваецца асобна, таму што «гэта адказала» — гэта не «гэта было так».
Згода на любыя далейшыя дзеянні: па фінансавых пытаннях лепш закрываць справу, чым адкрываць. Калі другі пілот выдумляе акно вяртання грошай, ён не стварае жывыя білеты. Калі ніхто не адкрывае зыходны код, ён таксама не стварае жывыя білеты.
Вынік
Ілюстрацыйны вынік выдуманага тэсту з 20 пытанняў, а не апублікаваная лічба членства ў Харбары.
Здагадкі: адзін другі супрацоўнік службы падтрымкі; дапаможнік за красавік 2026 года плюс рэшту PDF-файла за 2023 год; Прыя адпавядала крытэрыям вышэй; час быў вымераны як секундамер тэлефона з пытання, устаўленага ў «Я б адправіў гэта»; час праверкі ўключаны ў цыклічную ўмову і выключаны ў неўстаноўленую, наўмысна, каб параўнанне заставалася роўным.
Неправераны другі пілот, запыт у стылі дэманстрацыі: на 20 з 20 пытанняў быў дадзены плаўны адказ (час бесперабойнай працы выглядаў ідэальным). 11 з 20 адпавядалі крытэрыям. Пяць пытанняў былі ціхімі праваламі. Чатыры былі адкрытымі праваламі, у тым ліку 14-дзённае замарожванне. Два з чатырох адкрытых правалаў спасылаліся на фрагмент PDF-файла 2023 года ў форме зыходнага кода. Сярэдні час стварэння чарнавіка, які выглядаў прыдатным для адпраўкі, склаў 1 хвіліну.
Тыя ж 20 пытанняў, абмежаваныя інструкцыі, бачны атрыманы фрагмент: 15 з 20 былі цалкам правільнымі з красавіцкага тэксту. Трое правільна напісалі «не ў бягучым даведніку» (пункты, сумежныя з медыцынскім і юрыдычным аспектамі, плюс адна спрэчка аб аплаце), таму 18 з 20 былі прымальнымі. Двое ўсё роўна не змаглі: адзін дапісаў амаль што няўдалы PDF-файл за 2023 год, а адзін выдумаў лічбу ўступнага ўзносу, якой не было ў тэксте. Сярэдні час на напісанне чарнавіка ўсё яшчэ складаў каля 1 хвіліны.
Тыя ж 20, плюс Прыя, якая адкрыла цытаваны раздзел перад імітацыяй адпраўкі: 19 з 20 было б прымальна. Яна заўважыла PDF-файл, які амаль не заўважыў. Астатні промах быў у тым, што рэцэнзент бегла прагледзеў абзац і не заўважыў выдуманай лічбы ўступнага ўзносу. Сярэдні час, уключаючы рэцэнзію, склаў 3 хвіліны.
Стары працэс, толькі пошук па даведніку, без другога пілота: 20 з 20 прымальных. Медыяна 9 хвілін.
У гэтай выбарцы зацыклены другі пілот быў на 6 хвілін хутчэйшы за пошук па дапаможніку (9 мінус 3), або на 120 хвілін на 20 пытанняў, прычым 19 з 20 былі прымальнымі замест 20 з 20. Некантраляваны другі пілот быў на 8 хвілін хутчэйшы (9 мінус 1) і памыліўся, ціха ці гучна, у 9 з 20. Гэта не эканомія 67% часу, якую вы б уклалі ў рулявы пакет. Гэта ўцечка з 9 промахамі, якую вы б аўтаматызавалі.
Паспешлівыя версіі двух паўтаральных пытанняў, зададзеных начальнікам, перабольшвалі. Скептычныя версіі вагаліся. Тая ж мадэль, той жа дапаможнік, іншы касцюм. Прыя зарэгістравала гэта як адкрыццё, а не як характарыстыку асобы.
Гэтыя лічбы з'яўляюцца прыкладам ацэнкі, заснаваным на заяўленым тэсце, невялікай колькасці, квітках, якія было прасцей, чым раз'юшаны ўдзельнік, і адным рэцэнзентам, які ўжо ведаў кнігу. Яны не паказваюць, што другі пілот "надзейны на 95%" або што Harbour павінен скараціць супрацоўніка адміністрацыі. Яны паказваюць, што пытанне не было ў бесперабойнай працы, а ў праверцы.
Што можа пайсці не так
-
Кіраўніцтва цытуе час драфта за 1 хвіліну і прапускае 9 промахаў. Хуткасць усё яшчэ адчуваецца як кампетэнтнасць у 16:00.
-
PDF-файл 2023 года застаецца ў індэксе. Пошук працягвае яго шукаць. Зазямленне выглядае дарослым, але ўсё яшчэ амаль не атрымаецца.
-
Інтэрфейс хавае атрыманы фрагмент за бліскучай кнопкай адпраўкі. Карыстальнікі перастаюць адкрываць дапаможнік, і менавіта так замарожаны адказ даходзіць да ўдзельніка.
-
Прыя ацэньвае толькі восем простых пытанняў, таму што яны лепш выглядаюць на слайдзе. Тэатр ацэнкі, проста з дапамогай электроннай табліцы.
-
Адказ на пытанне «ці бяспечна гэта навучанне?», звязаны з медыцынай, можа выглядаць як кароткі змест. На карце было напісана «амаль ніколі». Тон казаў: «Працягвайце».
-
Журналы не запісваюцца, бо «здавалася, што гэта лішняе». Пасля промаху ніхто не бачыць, які ўрывак быў знойдзены.
-
Яны пытаюцца ў мадэлі, ці ўпэўненая яна. Так і ёсць. Гэта ніколі не было праверкай.
Практычны вывад
Надзейнасць — гэта не рыса, якую купіў Харбар, другі пілот. Гэта ўласцівасць 20 пытанняў, актуальнага кіраўніцтва, бачнага ўрыўка і чалавека, які ўсё яшчэ адкрывае зыходны код, калі справа даходзіць да грошай. Бегласць будзе працягваць праходзіць тэст на бесперабойную працу. Цыкл — адзінае, што праходзіць тэст на палітыку.
Часта задаваныя пытанні
Што ўвогуле азначае надзейнасць для генератыўнага штучнага інтэлекту?
Паўсядзённая надзейнасць азначае, што вы можаце на нешта абаперціся. З аўтаматызацыяй, якая гаворыць, цэлы набор уласцівасцей хаваецца пад адным словам: фактычнасць, паслядоўнасць, каліброўка, бяспека, бесперабойная праца, адчувальнасць да хуткасці, памежныя выпадкі і паводзіны пасля змены размеркавання. Ніводная з гэтых уласцівасцей не падводзіць разам. Тэст у рэжыме рэальнага часу надзейны для чаго, для каго, з якім цыклам вакол яго. У адваротным выпадку вы ацэньваеце блендар па тым, ці можа ён спраўляцца з падаткамі.
Ці надзейны штучны інтэлект?
Не як рыса. Магістр права можа быць бездакорным у адной працы і ціха выйсці з ладу ў наступнай, часам у той жа сеанс, а часам таму, што вы зрушылі коску. Надзейнасць — гэта ўласцівасць задачы, набору дадзеных, цыкла пошуку, ацэнкі, якая не з'яўляецца дэманстрацыяй, і чалавека, які ўсё роўна павінен мець гэта на ўвазе. Выкарыстоўвайце яе там, дзе промах танны або яго можна выкрыць. Запавольвайце працу там, дзе промах дорага каштуе.
Ці тое ж самае, што і праўдзівасць, калі працуе штучны інтэлект?
Не. Час бесперабойнай працы — гэта тое, ці адказала канцавая кропка. Праўдзівасць — гэта тое, ці быў адказ такім. Вы можаце мець сэрвіс, які ніколі не міргае, і ўсё роўна адпраўляць у кліенцкі запыт плыўную хлусню. Хуткасць адчуваецца як кампетэнтнасць, калі чарга — монстр. Бяспека — гэта яшчэ адна вось: мадэль, якая адмаўляецца ад джейлбрэйка, усё роўна можа скажаць рэзюмэ вашых уласных нататак.
Чаму свабодны штучны інтэлект здаецца вартым даверу, нават калі ён памыляецца?
Дакладнасць і бегласць разышліся, і бегласць трымала дом. Ступень магістра права (LLM) дасць вам рытм, падстрахоўку, магчыма, фальшывую, але прыгожую форму цытаты, і ваш мозг чытае: «гэты чалавек ведае». Каліброўка часта жахлівая: высокая ўпэўненасць, сярэдняй праўды, прамоўленая як асноўная даклада. Нязграбны няправільны адказ выклікае падазрэнні. Бегласць няправільнага адказу прымушае вас перастаць правяраць. Калі гэта напісана як кароткі змест, мы ставімся да гэтага як да кароткі зместу, і менавіта так памылка трапляе ў калоду.
Ці надзейны штучны інтэлект для медыцынскай, юрыдычнай працы або працы ў сферы падтрымкі кліентаў?
Гэта залежыць ад працы, а не ад брэнда. Медыцынская і юрыдычная кансультацыя амаль ніколі не бывае дастаткова добрай як прадукт: мадэль — гэта загаловак, а чалавек — прафесіянал. Служба падтрымкі кліентаў можа распрацаваць чарнавік у рамках строгай палітыкі, але чалавек павінен адказваць за адпраўку грошай і давяраць яму, таму што выдуманая палітыка і ветлівае няправільнае «не» — звычайная няўдача. Чарнавікі і рэзюмэ — гэта першы праход праз тэкст, які вы ўжо ведаеце. Праверце імёны, нумары і радок, які можа пашкодзіць.
Чаму ў штучнага інтэлекту галюцынацыі, дрэйф ці ціхае памыленне?
Галюцынацыя — гэта пікантны промах: кніга, якой не існуе, функцыя, якая ніколі не была адпраўлена, пункт палітыкі з лічбай, якая выглядае афіцыйна. Дрэйф менш кінематаграфічны: свет рухаецца, рэшткі мадэлі застаюцца, а вы атрымліваеце добра арганізаваны адказ з папярэдняга надвор'я. Ціхая няправільнасць — гэта рэзюмэ, якое апускае выключэнне. Або перафраз, які ператварае магчымае ў абавязковае. Фактычнасць можа выглядаць тэхнічна добра, у той час як сэнс знік. Хуткая адчувальнасць прымушае факты зіхацець, калі вы мяняеце абгортку.
Ці робіць зазямленне або пошук надзейным штучны інтэлект?
Зазямленне азначае адказ з гэтага, а не з туману. Атрыманне інфармацыі прыкручвае сучаснасць да падрыхтаванай кучы. Калі яно не працуе, яно не працуе ветліва: дакумент з амаль што памылкай, складзены артыкул, і ваш інстынкт праверкі спрацоўвае. Зазямленне — гэта падлога, а не арэол. Калі вы не можаце агледзець атрыманы кавалак, вы ўсё яшчэ ў тумане, проста з лепшым асвятленнем. Змяшайце задачы ў рэжыме рэальнага часу, такія як цэны або фармулёўка палітыкі, са стабільным крэслам, і вы атрымаеце вельмі ўпэўнены адказ пра свет, які ўжо змяніўся.
Чаму дэманстрацыя — дрэнная праверка надзейнасці штучнага інтэлекту?
Чыстая падказка і задача, з якой мадэль сутыкнулася тысячу разоў, будуць выглядаць акуратна. У жывых працоўных працэсах ёсць заблытаная ўстаўка, адсутныя файлы і карыстальнік, які прыме першы адказ, што зніжае яго трывожнасць. Бал у табліцы лідэраў — гэта не каліброўка вашых заказаў. Рызыка мадэлі — гэта тое, што адбываецца, калі нешта памыляецца ў аб'ёме, а не тое, ці прайшло яно набор віктарын. Вам патрэбныя сухія тэсты: заставайцеся ў межах атрыманага ўрыўка, пазначайце нявызначанасць замест таго, каб блефаваць, заставайцеся паслядоўнымі пры перафразіроўцы і зачыняйце задачу, а не выдумляйце.
Ці надзейны штучны інтэлект, калі ніхто не адказвае за гэта?
Не. Калі ніхто не нясе адказнасці, сістэма будзе выкарыстоўвацца так, быццам яна і ёсць. Чалавек у цыкле — адзіная канструкцыя, якая адпавядае рэжымам збояў: хто правярае, хто можа спыніць, што рэгіструецца, што адбываецца пасля промаху. Калі адказ — «мадэль», у вас няма адказу. Мадэлі не ідуць на сустрэчу пасля інцыдэнту. У медыцыне, юрыспрудэнцыі, крэдытаванні або аперацыях, крытычна важных для бяспекі, чалавек — гэта цыкл, а мадэль — заглушка.
Як мне падказаць штучнаму інтэлекту, каб я мог заўважыць памылкі?
Наўмысна пытайцеся пра нявызначанасць: «Што можа зрабіць гэта няправільным?» лепш, чым «зрабіце гэта ўпэўненым». Падзяліце пошук ад генерацыі, калі гэта магчыма. Спачатку паглядзіце на ўрыўкі, а потым папрасіце апісанне. Змяніце касцюм: перафразуйце або папрасіце аўтара давесці адваротнае. Увядзіце абмежаванні, такія як «толькі з тэксту, які я ўставіў» або «калі адсутнічае, скажыце, што адсутнічае», і ўсё роўна праверце. Аддавайце перавагу заданням з верыфікатарам і сачыце за дадатковай канкрэтнасцю, бо менавіта там любяць апранацца галюцынацыі.
Спасылкі
-
NIST - nvlpubs.nist.gov
-
NIST - airc.nist.gov
-
NIST - airc.nist.gov
-
ICO - ico.org.uk
-
NCSC - www.ncsc.gov.uk
-
NCSC - www.ncsc.gov.uk
-
OWASP - genai.owasp.org