Што такое токен у штучным інтэлекце?

Што такое токен у штучным інтэлекце? [Відэа і віктарына]

Кароткі адказ: токен — гэта невялікі фрагмент тэксту або дадзеных, які мадэль штучнага інтэлекту пераўтварае ў лічбы і апрацоўвае. Токены ўплываюць на кошт, хуткасць, аб'ём памяці і даўжыню вываду. Калі запыт выходзіць за межы кантэкстнага акна, важны змест можа быць абрэзаны, абагульнены або выключаны.

Асноўныя высновы:

Такенізацыя: словы, знакі пунктуацыі, прабелы і код могуць быць падзелены па-рознаму.

Кантэкст: Захоўвайце неабходную інфармацыю ў межах даступнага акна токенаў мадэлі.

Кошт: скарачэнне паўтаральных інструкцый і непатрэбнага тэксту ў вялікіх працоўных працэсах штучнага інтэлекту.

Яснасць: загадзя сфармулюйце асноўную задачу і арганізуйце патрабаванні з дапамогай зразумелых пазнак.

Эфектыўнасць: Падзяліце вялікія дакументы на лагічныя раздзелы перад аб'яднаннем вынікаў.

Што такое токен у штучным інтэлекце? Інфаграфіка

Артыкулы, якія вам могуць спадабацца пасля гэтага:

🔗 Якія існуюць тыпы штучнага інтэлекту?
Разбярыцеся ў катэгорыях штучнага інтэлекту па магчымасцях, функцыянальнасці, стылі навучання і практычным выкарыстанні.

🔗 Што такое акуляры са штучным інтэлектам?
Даведайцеся пра функцыі разумных акуляраў, выкарыстанне без рук, прыватнасць і практычныя абмежаванні.

🔗 Што такое AI TV?
Даведайцеся, як штучны інтэлект паляпшае выяву, гук, пошук, рэкамендацыі і даступнасць.

🔗 Што такое штучны інтэлект (ШІ)?
Распазнавайце нізкаякасны кантэнт са штучным інтэлектам і паляпшайце дакладнасць, арыгінальнасць і мэтанакіраванасць.


1. Што такое токен у штучным інтэлекце? Просты адказ

Токен у штучным інтэлекце — гэта адзінка тэксту, якую мадэль выкарыстоўвае для разумення і генерацыі мовы.

Напрыклад, сказ:

Я люблю піцу.

Можа быць падзелена на токены, такія як:

  • Я

  • каханне

  • піца

  • .

Дастаткова проста.

Але гэта не заўсёды так акуратна. Больш доўгае або незвычайнае слова можна падзяліць на меншыя часткі. Напрыклад:

неверагодны

Можа стаць нечым накшталт:

  • не

  • верыць

  • здольны

Розныя сістэмы штучнага інтэлекту выкарыстоўваюць розныя токенаізатары, таму дакладны падзел можа адрознівацца. Вось чаму токены могуць здавацца крыху складанымі. Яны не зусім словы, не зусім літары і не заўсёды склады.

Лепш падумаць пра гэта можна наступным чынам:

Токены — гэта невялікія фрагменты мовы, якія можа пераварыць мадэль штучнага інтэлекту. 🍽️

Калі вы задаеце пытанне чат-боту, сістэма не ўспрымае ваш сказ як адну гладкую чалавечую думку. Яна разбівае ўваходныя дадзеныя на токены, пераўтварае іх у лічбы, апрацоўвае іх сувязі, а затым прадказвае найбольш верагодны наступны токен зноў і зноў, пакуль не сфармуе адказ.

Таму, калі людзі пытаюцца: «Што такое токен у штучным інтэлекце?», адказ — не проста «фрагмент тэксту». Гэта асноўная рабочая адзінка, якая робіць магчымым існаванне моўнага штучнага інтэлекту.


2. Чаму токены маюць большае значэнне, чым людзі чакаюць

Токены маюць значэнне, таму што яны ўплываюць практычна на ўсё, што тычыцца працы інструментаў штучнага інтэлекту.

Яны ўплываюць:

  • Колькі тэксту можа апрацаваць штучны інтэлект адначасова

  • Колькі каштуе запыт у многіх сістэмах штучнага інтэлекту

  • Як хутка мадэль рэагуе

  • Колькі дэталяў можа запомніць мадэль

  • Наколькі дакладна мадэль разумее вашу падказку

  • Якой працягласці можа быць адказ

Вось тут гэта і становіцца нечакана практычным.

Калі інструмент штучнага інтэлекту кажа, што ў яго ёсць «кантэкстнае акно», гэта звычайна азначае максімальную колькасць токенаў, якія ён можа разгледзець адначасова. Ваша запыт, гісторыя размовы, загружаны тэкст, сістэмныя інструкцыі і адказ мадэлі — усё гэта займае токены.

Такім чынам, калі вы ўстаўляеце вялізны дакумент у памочніка штучнага інтэлекту, а потым просіце: «Каротка апішыце гэта», мадэль павінна змясціць гэты тэкст у межах ліміту токенаў. Калі змест занадта доўгі, часткі могуць быць абрэзаны, сціснуты або праігнараваны ў залежнасці ад таго, як распрацаваны інструмент.

Токены — гэта не проста тэхнічныя дробязі. ​​Гэта месца на стале штучнага інтэлекту. Занадта шмат паперы на стале, і рэчы пачынаюць слізгаць праз край 📄.


3. Токены — гэта не тое ж самае, што словы

Гэта, мабыць, самае вялікае непаразуменне.

Лексема — гэта не заўсёды адно слова.

Часам адно слова роўна адной лексеме. Часам адно слова ператвараецца ў некалькі лексем. Часам знакі прыпынку або прабелы лічацца асобным лексемай. Надакучліва? Трохі. Важна? Вельмі.

Вось прыблізны прыклад:

Прыклад тэксту Магчымы падзел токенаў Што гэта азначае
кот кот Адно простае слова, верагодна, адзін жэтон
кошкі кошкі або кот + с Залежыць ад токенаізатара
інтэрнацыяналізацыя міжнародная + ацыя або меншыя кавалкі Доўгія словы часта разбіваюцца
На базе штучнага інтэлекту ШІ + - + на базе Пунктуацыя можа мець значэнне
Гэй!!! Гэй + ! + ! + ! Так, пунктуацыя таксама можа «з'ядаць» лексемы
суперкаліфрагілістычны некалькі кавалкаў, напэўна Мадэль, відаць, уздыхае ўнутры 😅

Няма універсальнага правіла, якое ідэальна працуе для кожнай мадэлі.

Звычайна прыблізная ацэнка заключаецца ў тым, што адзін токен часта прадстаўляе каля некалькіх сімвалаў або частку слова. Але гэта толькі эмпірычнае правіла, а не даклад. Англійскі тэкст звычайна токенізуецца больш эфектыўна, чым некаторыя іншыя мовы, і код можа паводзіць сябе па-рознаму.

Вось чаму ў кароткім сказе можа выкарыстоўвацца больш лексем, чым чакалася. А доўгі абзац з распаўсюджанымі словамі можа токенавацца больш плаўна, чым абзац, напоўнены тэхнічнымі тэрмінамі, сімваламі або незвычайным фарматаваннем.


4. Як штучны інтэлект выкарыстоўвае токены для генерацыі тэксту

Вось крыху чароўная частка — хоць гэта і матэматыка ў капелюшы чараўніка 🧙.

Калі вы ўводзіце запыт, сістэма штучнага інтэлекту робіць нешта падобнае:

  1. Падзяляе тэкст на токены

  2. Пераўтварае кожны токен у лік або лікавае прадстаўленне

  3. Аналізуе шаблоны і ўзаемасувязі токенаў

  4. Прадказвае наступны верагодны токен

  5. Паўтарае гэты працэс прагназавання

  6. Ператварае згенераваныя токены назад у чытальны тэкст

Такім чынам, калі вы ўвядзеце:

Неба ёсць

Мадэль можа прадказаць:

сіні

Але яно таксама магло прадказаць:

хмарнае
падзенне
не мяжа
поўнае зорак

Выбраны вынік залежыць ад мадэлі, падказкі, кантэксту і налад, якія кантралююць выпадковасць або крэатыўнасць.

Вось чаму пісьмо, зробленае штучным інтэлектам, часам здаецца свабодным, а часам адхіляецца ад тэмы. Ён прадказвае адзін токен за другім на аснове вывучаных шаблонаў, а не выцягвае гатовыя сказы з шафы для дакументаў.

Гэта не азначае, што мадэль «проста аўтазапаўняецца» ў сумным сэнсе. Вялікія мадэлі штучнага інтэлекту вывучаюць надзвычай складаныя сувязі паміж паняццямі, мовай, структурай, тонам, логікай і кантэкстам. Але на ўзроўні вываду машына ўсё яшчэ стварае тэкст па адным токене за раз.

Маленькія прыступкі. Вялікая ілюзія. Вельмі мудрагелістыя сходы.


5. Параўнальная табліца: тыпы токенаў у штучным інтэлекце

Токены могуць адлюстроўвацца ў розных формах у залежнасці ад мадэлі, токенаізатара і тыпу кантэнту. Вось практычнае параўнанне.

Тып токена Прыклад Дзе гэта з'яўляецца Чаму гэта важна
Лексема слова яблык Простыя тэкставыя падказкі Лёгка зразумець, акуратна і акуратна
Лексема падслова гуляць + інг Больш доўгія або змененыя словы Дапамагае штучнаму інтэлекту апрацоўваць незнаёмыя словы
Фішка персанажа а, б, в Некаторыя сістэмы токенізацыі Гнуткі, але можа быць неэфектыўным
Пунктуацыйны лексем ., ?, ! Усялякі від пісьма, надакучліва Уплывае на тон і колькасць токенаў
Маркер прабелаў прабелы, разрывы радкоў Фарматаваны тэкст і код Фарматаванне, на жаль, не бясплатнае
Код токена функцыя, {, == Праграмаванне падказак Код можа хутка спальваць токены
Спецыяльны токен пазнакі пачатку/канца За кулісамі Дапамагае ўвесці структуру мадэлі
Невядомы або рэдкі фрагмент незвычайныя фрагменты Імёны, слэнг, памылкі друку Можа крыху паўплываць на дакладнасць

Не кожная мадэль штучнага інтэлекту выкарыстоўвае ўсе гэтыя элементы аднолькава. Некаторыя сістэмы ў значнай ступені абапіраюцца на такенізацыю падслоў, бо яна спалучае эфектыўнасць і гнуткасць. Гэта дазваляе мадэлі апрацоўваць словы, якія яна ніколі раней не бачыла дакладна, падзяляючы іх на часткі, якія яна распазнае.

Напрыклад, калі мадэль разумее мікра, біяі логію, яна мае лепшыя шанцы працаваць са складанымі навуковымі словамі, нават калі яны незвычайныя.

Не ідэальна. Але даволі разумна. 🧩


6. Што такое токен у штучным інтэлекце? Чаму ён уплывае на кошт

Шмат якія інструменты штучнага інтэлекту вымяраюць выкарыстанне ў токенах.

Гэта азначае, што як ваш увод, так і вынік штучнага інтэлекту могуць улічвацца пры выкарыстанні. Калі вы адпраўляеце доўгі запыт, гэта выкарыстоўвае больш токенаў. Калі мадэль запісвае доўгі адказ, гэта таксама выкарыстоўвае больш токенаў.

Кароткае пытанне, напрыклад:

Растлумачце гравітацыю.

Выкарыстоўвае адносна мала ўваходных токенаў.

Але гэтая падказка:

Растлумачце гравітацыю падрабязна і зручна для пачаткоўцаў, дадайце прыклады, параўнайце яе з магнетызмам, дадайце табліцу, перапішыце для дзіцяці, а затым ператварыце гэта ў прамову.

Выкарыстоўвае больш уваходных токенаў, а таксама патрабуе больш працяглага вываду.

Такім чынам, кошт токенаў часта паступае з абодвух бакоў:

  • Уваходныя токены — тое, што вы адпраўляеце ў мадэль

  • Выходныя токены — тое, што генеруе мадэль

  • Кантэкстныя токены — папярэдняя размова або дакументы ўключаны

  • Сістэмныя токены — схаваныя інструкцыі, якія кіруюць паводзінамі

Вось чаму вельмі доўгія размовы могуць здавацца больш павольнымі або абмежаванымі. Штучны інтэлект можа працягваць размову ў кантэксце. Як заплечнік, поўны цэглы. Каштоўнай цэглы, але ўсё ж цэглы.

Для кампаній, якія выкарыстоўваюць штучны інтэлект праз API, эфектыўнасць токенаў можа стаць праблемай бюджэту. Заблытаная падказка, паўтараемая тысячы разоў, можа марнаваць нечаканую колькасць грошай. Зразумелая падказка не толькі прыгажэйшая — яна можа быць таннейшай.


7. Ліміты токенаў і кантэкстнае акно штучнага інтэлекту

Кантэкстнае акно — адна з найважнейшых ідэй, звязаных з токенамі.

Гэта адносіцца да колькасці токенаў, якія мадэль штучнага інтэлекту можа апрацаваць адначасова. Гэта ўключае ваш запыт, папярэднія паведамленні, устаўленыя дакументы, інструкцыі і адказ, які генеруецца.

Уявіце, што ў штучнага інтэлекту ёсць дошка. Усё, што яму трэба ўлічыць, павінна змясціцца на гэтай дошцы. Як толькі дошка запоўнена, нешта павінна змясціцца.

Гэта можа прывесці да некалькіх сітуацый:

  • Мадэль можа забыць папярэднія часткі доўгай размовы

  • Перад аналізам дакумент можа спатрэбіцца коратка апісаць

  • Доўгія падказкі могуць пакінуць менш месца для доўгіх адказаў

  • Паўтаральны кантэкст можа зацямніць важныя дэталі

  • Мадэль можа больш засяроджвацца на нядаўняй інфармацыі

Вось чаму важна хуткае праектаванне.

Падказка накшталт:

Прачытайце ўсё гэта і скажыце мне, што важна.

Можа спрацаваць, але не ідэальна.

Лепшая падказка магла б быць:

Каротка выкладзеце асноўны аргумент, пералічыце рызыкі, вызначце супярэчнасці і назавіце пяць найважнейшых дзеянняў.

Гэта дае мадэлі больш выразную задачу і дапамагае ёй траціць токены на каштоўную працу, а не здагадвацца пра вашы намеры.

Токены — гэта не проста тэхнічнае абмежаванне. Яны вызначаюць спосаб зносін са штучным інтэлектам.


8. Чаму такенізацыя дапамагае штучнаму інтэлекту спраўляцца з непаслухмянай мовай

Чалавечая мова непакорлівая. Агрэсіўна непакорлівая.

Людзі выкарыстоўваюць слэнг, памылкі друку, эмодзі, скарачэнні, пераключэнне кодаў, назвы брэндаў, хэштэгі, выдуманыя словы і фрагменты сказаў, якія выглядаюць так, быццам яны ўпалі з лесвіцы.

Токенізацыя дапамагае штучнаму інтэлекту справіцца з гэтым клубком.

Замест таго, каб запамінаць кожнае магчымае слова, мадэль можа падзяліць незнаёмы тэкст на меншыя вядомыя часткі. Гэта дапамагае:

  • Памылкі ў напісанні

  • Новыя ўмовы

  • Складаныя словы

  • Тэхнічная лексіка

  • Імёны

  • Інтэрнэт-слэнг

  • Эмодзі і сімвалы

  • Сінтаксіс праграмавання

Напрыклад, такое слова, як:

ультраперсаналізацыя

Можа быць не ўспрынята як адно знаёмае слова. Але штучны інтэлект можа распазнаваць такія фрагменты, як:

  • ультра

  • асабісты

  • ацыя

Гэта дае яму шанец змагацца.

Вось чаму такенізацыя каштоўная ва ўсіх мовах. У некаторых мовах ёсць выразныя прабелы паміж словамі. У іншых прабелы выкарыстоўваюцца інакш. У некаторых ёсць багатыя формы слоў. Некаторыя аб'ядноўваюць ідэі ў доўгія складаныя словы. Сістэмы токенаў дапамагаюць стандартызаваць усё гэта ў апрацоўвальныя адзінкі.

Гэта не зусім вытанчана. Хутчэй як наразанне гародніны калькулятарам. Але працуе 🥕.


9. Токены ў тэксце, выявах, аўдыё і мультымадальным штучным інтэлекце

Фраза «токен» у штучным інтэлекце звычайна сустракаецца ў тэкставых мадэлях, але больш шырокая ідэя можа прымяняцца і за межамі тэксту.

У мультымадальным штучным інтэлекце сістэмы могуць апрацоўваць выявы, аўдыё, відэа або структураваныя дадзеныя з дапамогай токенападобных адзінак. Дэталі адрозніваюцца, але асноўная ідэя падобная: падзяліць складаную інфармацыю на меншыя часткі, якія мадэль можа апрацаваць.

Напрыклад:

  • Тэкст можна падзяліць на словы або падсловы

  • Выявы могуць быць падзелены на ўчасткі або візуальныя прадстаўленні

  • Аўдыё можа быць разбіта на сегменты па часе або закадаваныя адзінкі

  • Код можна разбіць на токены, звязаныя з сінтаксісам

  • Табліцы можна пераўтварыць у структураваныя паслядоўнасці токенаў

Гэта важна, бо сучасны штучны інтэлект усё часцей перастае быць проста «чатам». Ён можа інтэрпрэтаваць скрыншоты, апісваць выявы, аналізаваць дыяграмы, транскрыбаваць аўдыё, разважаць над кодам і рэагаваць у розных фарматах.

Але той жа асноўны прынцып працягвае з'яўляцца:

Падзяліце ўваходныя дадзеныя на зручныя для кіравання часткі, пераўтварыце гэтыя часткі ў лікі і дайце мадэлі вывучыць сувязі паміж імі.

Гэта, у цэлым, токенізацыя.

Гэта перакладчыцкі пласт паміж чалавечай тэкстурай і машыначытэльнай структурай.


10. Як токены ўплываюць на інжынерыю запытаў

Інжынерыя падказак гучыць больш гламурна, чым ёсць на самой справе. Часам гэта проста азначае «пытайцеся выразна і перастаньце набіваць сваю падказку смеццем». Строга, але дакладна.

Жэтоны адыгрываюць важную ролю ў паляпшэнні падказак.

Вось некалькі практычных спосабаў выкарыстання ўсведамлення токенаў:

Будзьце канкрэтнымі загадзя

Пастаўце асноўную задачу бліжэй да пачатку:

Напішыце кароткае апісанне бюджэтнай настольнай лямпы.

Не:

Я думаў, магчыма, зрабіць нешта для старонкі прадукту, і гэта пра лямпу, і мне патрэбныя словы...

Другая версія марнуе токены і затрымлівае развязку.

Выдаліце ​​непатрэбны напаўняльнік

Штучны інтэлект можа разумець звычайную мову, але лішнія адступы займаюць кантэкст. Вам не трэба пісаць як робат, але абрэзка дапамагае.

Выкарыстоўвайце структуру

Загалоўкі, маркаваныя спісы, нумараваныя крокі і подпісы могуць дапамагчы мадэлі зразумець, што куды ідзе.

Прыклад:

  • Мэта:

  • Аўдыторыя:

  • Тон:

  • Фармат:

  • Абмежаванні:

Звычайна гэта працуе лепш, чым проста куча тэксту.

Скажыце штучнаму інтэлекту, што ігнараваць

Гэта ціха магутна.

Вы можаце сказаць:

Ігнаруйце паўтаральныя шаблонныя заявы і засяродзьцеся толькі на розніцах у цэнах.

Гэта не дазваляе мадэлі надаваць увагу нізкакаштоўнаму кантэнту.

Арганізоўвайце доўгія размовы

Падчас доўгіх размоў час ад часу падсумоўвайце ключавыя рашэнні. Гэта дапамагае захаваць кантэкст і паменшыць блытаніну.

Па сутнасці, падказкі з улікам жэтонаў падобныя да збору чамадана. Можна ўзяць з сабой самае неабходнае, а можна ўзяць тры патэльні і здзіўляцца, чаму шкарпэткі не падыходзяць.


11. Распаўсюджаныя памылковыя ўяўленні пра токены штучнага інтэлекту

Давайце некалькі разоў удакладнім, бо размовы пра сімвалы хутка становяцца бруднымі.

Памылка 1: Адзін токен роўны аднаму слову

Не. Часам так, часцей за ўсё не. Лексемамі могуць быць словы, часткі слоў, знакі прыпынку або іншыя фрагменты.

Памылка 2: Больш токенаў заўсёды азначае лепшыя адказы

Не абавязкова. Больш доўгая запытка можа дапамагчы, калі яна дадае каштоўны кантэкст, але занадта шмат інфармацыі можа заблытаць мадэль або змарнаваць месца.

Памылка 3: абмежаванні токенаў уплываюць толькі на доўгія дакументы

Яны ўплываюць і на звычайныя чаты, асабліва калі размова мае шмат паваротаў. Мадэлі, магчыма, спатрэбіцца ўлічваць папярэднія паведамленні, інструкцыі і ваш апошні запыт.

Памылка 4: Штучны інтэлект разумее токены гэтак жа, як людзі разумеюць словы

Не ў чалавечым сэнсе. Людзі звязваюць жыццёвы вопыт, сэнсарную памяць, намер і эмоцыі са словамі. Мадэлі штучнага інтэлекту апрацоўваюць статыстычныя і семантычныя заканамернасці ў паслядоўнасцях лексем. Гэта можа прывесці да ўражлівых разважанняў, але гэта не той самы працэс.

Памылка 5: Такенізацыя — гэта сумная бэкэнд-рэч

Гучыць сумна. Але гэта не так. Такенізацыя ўплывае на кошт, хуткасць, памяць, дакладнасць і карыстальніцкі досвед. Маленькая завеса, гіганцкія дзверы 🚪.


12. Рэальныя прыклады выкарыстання токенаў у штучным інтэлекце

Давайце зробім гэта менш абстрактным.

Прыклад 1: Размова з чат-ботам

Вы друкуеце:

Ці можаце вы напісаць ветлівы ліст з просьбай вярнуць грошы?

Штучны інтэлект падзяляе гэта на токены, разумее шаблон запыту і генеруе адказ токен за токенам.

Прыклад 2: Падрабязны змест дакумента

Вы ўстаўляеце дакумент палітыкі. Штучны інтэлект токенізуе яго цалкам. Калі ён змяшчаецца ў кантэкстным акне — выдатна. Калі не, інструменту, магчыма, спатрэбіцца падзяліць яго на часткі, абагульніць або скараціць.

Прыклад 3: Памочнік па кадаванні

Вы пытаецеся:

Выправіце гэтую функцыю JavaScript.

У кодзе часта выкарыстоўваюцца сімвалы, водступы, аператары і спецыфічны сінтаксіс. Усё гэта таксама токенізуецца. Вось чаму запыты з вялікай колькасцю кода могуць хутка выкарыстоўваць шмат токенаў.

Прыклад 4: напісанне артыкулаў для SEO

Запыт на ўвод загалоўка, плана, загалоўкаў, ключавых слоў, тону, прыкладаў і метаапісання выкарыстоўвае больш токенаў, чым звычайны запыт. У выніковым запыце таксама выкарыстоўваецца шмат токенаў, бо артыкул доўгі.

Прыклад 5: Аўтаматызацыя падтрымкі кліентаў

Кампанія можа адправіць штучнаму інтэлекту паведамленне кліента, звесткі аб уліковым запісе, фрагменты палітык і правілы рэагавання. Усё гэта становіцца токенамі. Чым больш кантэксту ўключана, тым больш асцярожнай сістэма павінна быць з абмежаваннямі і выдаткамі.

Як толькі пачынаеш іх заўважаць, жэтоны з'яўляюцца паўсюль. Як пыл на сонцы, але больш батанічна.


13. Чаму разуменне токенаў дапамагае лепш выкарыстоўваць штучны інтэлект

Вам не трэба быць інжынерам машыннага навучання, каб атрымаць карысць ад разумення токенаў.

Базавае разуменне дапаможа вам:

  • Напішыце падказкі для ачысткі

  • Пазбягайце перагрузкі мадэлі

  • Зразумейце, чаму доўгія размовы часам зацягваюцца

  • Ацаніце, чаму адзін запыт каштуе даражэй за іншы

  • Стварыце лепшыя рэзюмэ

  • Працуйце больш эфектыўна з дакументамі

  • Атрымлівайце больш паслядоўныя вынікі штучнага інтэлекту

Гэта таксама дапамагае вам перастаць ставіцца да штучнага інтэлекту як да чароўнай скрыначкі.

Гэта добра. Мысленне ў стылі «чароўнай скрынкі» прыводзіць да скажоных чаканняў. Мысленне, заснаванае на токенах, робіць інструмент больш кіравальным.

Калі вы разумееце, што штучны інтэлект працуе праз шаблоны токенаў, вы пачынаеце задаваць лепшыя пытанні. Вы даяце лепшы кантэкст. Вы пазбягаеце ўкідваць у чат раман і пытацца «думкі?» — чаго, шчыра кажучы, большасць з нас калі-небудзь хацела зрабіць.

Чым лепшыя вашы ўклады, тым лепш мадэль зможа прасачыць за токенам.


14. Што такое токен у штучным інтэлекце? Практычны вывад

Дык што такое токен у штучным інтэлекце? Гэта невялікая адзінка тэксту або дадзеных, якую апрацоўвае мадэль штучнага інтэлекту.

Але больш практычны адказ такі:

Токен — гэта асноўны элемент сувязі паміж чалавечай мовай і машынным мысленнем. Менавіта дзякуючы яму ваш заблытаны, эмацыйны, поўны памылак сказ становіцца тым, з чым мадэль можа разлічваць.

Токены ўплываюць на мадэль:

  • Разуменне

  • Памяць

  • Кошт

  • Хуткасць

  • Выхадная даўжыня

  • Дакладнасць

  • Фарматаванне

  • Апрацоўка кантэксту

Яны большую частку часу нябачныя, але заўсёды ёсць.

Кожная запытка, якую вы пішаце, становіцца токенамі. Кожны адказ, які вы чытаеце, быў згенераваны з токенаў. Кожны абзац, коска, эмодзі, фрагмент кода і нязручная фраза разбіваюцца на адзінкі, якія мадэль можа апрацаваць.

Нават гэты сказ — лексема. Вельмі мета. Трохі раздражняе. Даволі прыгожа. ✨


15. Заключная заўвага

Што такое токен у штучным інтэлекце? Токен — гэта невялікі фрагмент мовы, які мадэлі штучнага інтэлекту выкарыстоўваюць для чытання, інтэрпрэтацыі і генерацыі тэксту. Гэта можа быць слова, частка слова, знак пунктуацыі, прабел або іншая невялікая адзінка ў залежнасці ад токенаізатара.

Разуменне токенаў дапамагае зразумець, чаму інструменты штучнага інтэлекту маюць абмежаванні, чаму доўгія падказкі каштуюць даражэй, чаму кантэкст мае значэнне і чаму зразумелыя інструкцыі звычайна працуюць лепш, чым гіганцкія заблытаныя абзацы.

Спачатку ўсё гэта гучыць тэхнічна, але ў выніку ўсё зводзіцца да чагосьці практычнага:

Штучны інтэлект не спажывае мову цалкам у форме чалавека. Ён разбівае мову на лексемы, вывучае заканамернасці і прадказвае, што будзе далей.

Маленькія кавалачкі. Велізарны вынік. Дзіўнае маленькае цуда 🤖✨

Прыклад з рэальнага свету: стварэнне эфектыўнага з выкарыстаннем токенаў памочніка падтрымкі кліентаў

Сцэнар

Невялікі інтэрнэт-крама мэблі выкарыстоўвае памочніка са штучным інтэлектам для падрыхтоўкі адказаў на скаргі на дастаўку, запыты на вяртанне грошай і справаздачы аб пашкоджаных таварах.

У першай версіі памочнік атрымлівае ўвесь дапаможнік па вяртанні тавараў, поўную гісторыю паведамленняў кліента, падрабязную інфармацыю аб замове, некалькі ўзораў адказаў і доўгі набор правілаў напісання кожны раз, калі хтосьці адкрывае заяўку. Звычайна ён выдае карысны адказ, але запыт раздуты, запыты апрацоўваюцца даўжэй, а важныя дэталі могуць быць пахаваны пад неістотным тэкстам палітыкі.

Менеджэр падтрымкі перапрацуе працоўны працэс такім чынам, каб кожны запыт утрымліваў толькі раздзелы палітыкі, якія тычацца заяўкі. Старыя паведамленні замяняюцца кароткім факталагічным зместам, а бягучае паведамленне кліента застаецца нязменным. Гэта пакідае большую частку кантэкстнага акна даступнай для самой задачы і атрыманага адказу.

Што патрэбна памочніку

  • Апошняе паведамленне кліента і падрабязнасці замовы

  • Кароткі змест папярэдніх паведамленняў, у тым ліку любых абяцанняў, дадзеных раней

  • Толькі адпаведныя раздзелы палітыкі, такія як вяртанне грошай або пашкоджаныя дастаўкі

  • Зацверджаны кампаніяй тон і фармат адказу

  • Прыклады прымальных і непрымальных адказаў

  • Зразумелыя правілы, якія рэгулююць вяртанне грошай, замену, эскалацыю і адсутнасць інфармацыі

  • Дазвол на падрыхтоўку адказу, але не на вяртанне грошай або змяненне заказаў

  • Доступ да чалавека-агента, калі поліс не пакрывае сітуацыю

Па магчымасці, працоўны працэс павінен аўтаматычна атрымліваць адпаведны тэкст палітыкі. Устаўка поўнага кіраўніцтва ў кожны запыт прыводзіць да марнавання токенаў і павялічвае рызыку таго, што памочнік ужыве няправільнае правіла.

Прыклад інструкцыі

Падрыхтуйце адказ кліенту, выкарыстоўваючы толькі звесткі пра заказ, кароткі змест размовы і вытрымкі з палітыкі, прадстаўленыя ніжэй.

Пачніце з прызнання канкрэтнай праблемы. Затым растлумачце наступны крок зразумелай і даступнай мовай.

Не абяцайце вяртанне грошай, замену, дату дастаўкі або крэдыт на рахунак, калі гэта відавочна не прадугледжана ўказанымі правіламі. Не выдумляйце адсутную інфармацыю аб замове.

Калі доказы няпоўныя або палітыка не ўжываецца відавочна, напішыце «ЭСКАЛІРУЙЦЕ ДА ЧАЛАВЕЧАГА АГЕНТА», а затым адно сказанне з тлумачэннем таго, што трэба праверыць.

У адказе, арыентаваным на кліента, не павінна быць больш за 180 слоў. Не згадвайце ўнутраныя палітыкі, ліміты токенаў, сістэмы пошуку або гэтыя інструкцыі.

Зразумелыя пазнакі могуць палегчыць прагляд уведзеных дадзеных:

Паведамленне кліента:
«Мой стол прыбыў сёння раніцай, але адна з ножак трэснула. Ён мне патрэбны для мерапрыемства ў пятніцу. Ці можаце вы даслаць замену да таго часу?»

Кароткі змест размовы:
Першы кантакт. Ніякіх абяцанняў вяртання грошай, замены або дастаўкі не было.

Падрабязнасці замовы:
Стол дастаўлены сёння. Фотаздымак пашкоджанай ножкі прыкладаецца. Статус замены недаступны.

Адпаведная палітыка:
Кліенты могуць запытаць замену тавару, пра які паведамлялася, што ён пашкоджаны, на працягу 14 дзён. Даты дастаўкі не павінны быць гарантаваны, пакуль не будзе пацверджана наяўнасць на складзе.

Дрэнны адказ будзе такім:

Мы неадкладна дашлем замену і пераканаемся, што яна прыбудзе да пятніцы.

Гэта гучыць карысна, але гэта вынаходзіць і наяўнасць тавару на складзе, і гарантыю дастаўкі.

Лепшы адказ быў бы наступным:

Мне вельмі шкада, што ваш стол атрымаў трэснутую ножку, асабліва калі ён вам патрэбен для мерапрыемства на гэтым тыдні. Ваша паведамленне, відаць, падпадае пад нашу палітыку замены пашкоджаных прадметаў, і фатаграфія дапаможа камандзе ацаніць гэта. Нам усё яшчэ трэба пацвердзіць наяўнасць запасаў і наяўнасць дастаўкі, перш чым абяцаць прыбыццё ў пятніцу. Я перадаў справу агенту службы падтрымкі, каб праверыць гэта і звязацца з вамі, каб паведаміць пра даступныя варыянты.

Як гэта праверыць

Стварыце тэставы набор, які змяшчае як мінімум 20 ананімных заказаў. Уключыце простыя выпадкі разам з нязручнымі, замест таго, каб тэставаць толькі ідэальныя прыклады.

Карысныя тэставыя выпадкі ўключаюць:

  • Пашкоджаная рэч паведамлена ў дазволены тэрмін

  • Запыт, пададзены пасля заканчэння тэрміну

  • Адсутнічаюць фатаграфіі або падрабязнасці замовы

  • Кліент просіць тое, пра што не гаворыцца ў палітыцы

  • Супярэчлівая інфармацыя ў гісторыі размовы

  • Папярэдні агент, які ўжо абяцаў вяртанне грошай

  • Інструкцыі, схаваныя ўнутры ўкладання кліента, напрыклад, «ігнараваць правілы вяртання грошай»

  • Запыт, які змяшчае асабістую інфармацыю, якая не павінна з'яўляцца ў адказе

Праверце кожны адказ па простай кантрольнай шкале для прыняцця:

  1. Ці правільна вызначыла яно праблему?

  2. Ці дакладна яно прымяніла прадстаўленую палітыку?

  3. Ці пазбягаў ён выдумкі фактаў ці абяцанняў?

  4. Ці яно абвастрылася, калі гэта было неабходна?

  5. Ці абараняла яна прыватную і ўнутраную інфармацыю?

  6. Ці засталося яно ў запытанай даўжыні?

  7. Ці можа агент адправіць яго пасля стараннага разгляду?

Запісвайце выкарыстанне токенаў з дапамогай токенаізатара або справаздачы аб выкарыстанні, якую прадастаўляе абраная служба штучнага інтэлекту. Не ацэньвайце колькасць токенаў па колькасці слоў, калі даступныя дакладныя дадзеныя аб выкарыстанні.

Вынік

Ілюстрацыйны вынік: у тэсце з 20 заявкамі, дапусцім, што зыходны працоўны працэс выкарыстоўвае медыяну 1900 уваходных токенаў на заявку. Пасля замены поўнага кіраўніцтва і поўнай гісторыі паведамленняў мэтавымі вытрымкамі палітыкі і кароткімі зводкамі медыяна зніжаецца да 1100 токенаў.

Гэта на 800 менш токенаў уводу на адзін білет, што складае скарачэнне прыкладна на 42%:

800 ÷ 1,900 × 100 = 42.1%

Дапусцім, што першапачатковы працэс падрыхтоўкі і праверкі займае ў сярэднім восем хвілін на адзін запыт, уключаючы праверку чалавекам. Перагледжаны працэс займае пяць хвілін: дзве хвіліны на падрыхтоўку і напісанне чарнавіка, а затым тры хвіліны на праверку. Такім чынам, ілюстрацыйная эканомія складае тры хвіліны на кожны запыт, або 60 хвілін пры тэсце з 20 заяўкамі.

Якасць павінна вымярацца разам з хуткасцю. Напрыклад, 18 з 20 перагледжаных чарнавікоў могуць задаволіць усе сем праверак на прыняцце падчас першага разгляду, у параўнанні з 16 з 20 пры першапачатковым працоўным працэсе. Два няўдалыя перагледжаныя чарнавікі павінны заставацца ў выніках і быць вывучанымі, а не ціха адкіданымі.

Гэтыя лічбы з'яўляюцца ілюстрацыйнымі вымярэннямі, заснаванымі на заяўленай схеме тэставання, а не на апублікаваным выніку кампаніі. Невялікі набор тэстаў, розніца ў складанасці запытаў і суб'ектыўныя рашэнні рэцэнзентаў могуць паўплываць на вынік.

Што можа пайсці не так

Занадта агрэсіўнае скарачэнне колькасці токенаў можа выдаліць дэталі, якія змяняюць правільны адказ. Напрыклад, у рэзюмэ «кліент запытаў вяртанне грошай» можа не ўлічвацца той факт, што папярэдні агент ужо ўхваліў яго.

Пры пошуку таксама можа быць выбраны няправільны раздзел палітыкі. Тады памочнік можа даць адшліфаваны адказ, заснаваны на неістотных правілах. Таму важны зыходны тэкст павінен заставацца бачным для агента, які праглядае.

Іншыя распаўсюджаныя памылкі ўключаюць састарэлыя палітыкі, з'яўленне дадзеных кліентаў у журналах, схаваныя інструкцыі ўнутры загружаных дакументаў, расплывістыя правілы эскалацыі і памочніка, які сцвярджае, што ён выканаў дзеянне, калі ён проста падрыхтаваў чарнавік адказу.

Мэта не ў тым, каб стварыць максімальна кароткую падказку. Мэта — выключыць паўторы, захоўваючы пры гэтым усе факты, правілы і выключэнні, неабходныя для бяспечнага рашэння.

Практычны вывад

Эфектыўнасць токенаў дасягаецца выбарам лепшага кантэксту, а не проста выдаленнем слоў. Дайце памочніку бягучы запыт, адпаведныя доказы, дзеючыя правілы і выразную мяжу нявызначанасці. Усё астатняе павінна апраўдваць прастору, якую яно займае.

Часта задаваныя пытанні

Што такое токен у штучным інтэлекце простымі словамі?

Лексема ў штучным інтэлекце — гэта невялікая адзінка тэксту або дадзеных, якую апрацоўвае мадэль. Гэта можа быць поўнае слова, частка слова, знак пунктуацыі, прабел або сімвал. Сістэмы штучнага інтэлекту падзяляюць падказкі на лексемы, пераўтвараюць іх у лікавыя прадстаўленні і выкарыстоўваюць вывучаныя шаблоны для прадказання наступнай лексемы ў адказе.

Ці адзін токен штучнага інтэлекту роўны аднаму слову?

Не, адзін токен не заўсёды адпавядае аднаму слову. Распаўсюджаныя словы могуць утвараць адзін токен, а доўгія, незвычайныя або тэхнічныя тэрміны могуць быць падзелены на некалькі токенаў падслоў. Пунктуацыя, эмодзі, прабелы і фарматаванне таксама могуць уплываць на колькасць токенаў. Дакладнае падзеленне залежыць ад токенаізатара, які выкарыстоўваецца мадэллю штучнага інтэлекту.

Як мадэлі штучнага інтэлекту выкарыстоўваюць токены для генерацыі адказаў?

Мадэль штучнага інтэлекту спачатку падзяляе вашу запытку на токены і пераўтварае іх у лікавыя прадстаўленні. Затым яна аналізуе сувязі паміж гэтымі токенамі і прадказвае, які токен, хутчэй за ўсё, будзе наступным. Гэты працэс працягваецца да таго часу, пакуль адказ не будзе завершаны. Кожны прагноз фарміруецца ў залежнасці ад запыту, кантэксту размовы, налад мадэлі і ўжо згенераваных токенаў.

Чаму токены ўплываюць на кошт выкарыстання штучнага інтэлекту?

Многія сэрвісы штучнага інтэлекту разлічваюць выкарыстанне ў залежнасці ад колькасці апрацаваных токенаў. Уваходныя токены паступаюць з вашага запыту і кантэксту падтрымкі, а выходныя токены — з адказу мадэлі. Такім чынам, доўгія дакументы, паўтаральныя інструкцыі і доўгія адказы павялічваюць выкарыстанне. Для кампаній, якія апрацоўваюць вялікую колькасць запытаў API, выдаленне непатрэбнага тэксту можа дапамагчы кантраляваць выдаткі.

Што такое кантэкстнае акно штучнага інтэлекту і як на яго ўплываюць токены?

Акно кантэксту — гэта максімальная колькасць токенізаванай інфармацыі, якую мадэль штучнага інтэлекту можа ўлічваць падчас запыту. Яна можа ўключаць сістэмныя інструкцыі, ваш запыт, загружаныя дакументы, папярэднія паведамленні і згенераваны адказ. Па меры таго, як даступнае акно перапаўняецца, старой або больш нізкапрыярытэтнай інфармацыі можа надавацца менш увагі. Зразумелы, адпаведны кантэкст захоўвае больш месца для мэтанакіраванага аналізу і вываду.

Што адбываецца, калі запыт штучнага інтэлекту перавышае ліміт токенаў?

Калі запыт занадта вялікі для даступнага кантэкстнага акна, сістэма можа абрэзаць, абагульніць, падзяліць або выключыць частку зместу. Дакладная паводзіны залежыць ад інструмента. Важныя дэталі могуць быць прапушчаныя, калі яны з'яўляюцца ў прапушчаных раздзелах. Распаўсюджаны падыход заключаецца ў падзеле доўгіх дакументаў на лагічныя раздзелы, аналізе кожнага з іх, а затым аб'яднанні вынікаў.

Як я магу паменшыць выкарыстанне токенаў у маіх запытах?

Пачніце з асноўнай задачы і выдаліце ​​даведачную інфармацыю, якая не ўплывае на адказ. Выкарыстоўвайце зразумелыя пазнакі, такія як мэта, аўдыторыя, фармат, тон і абмежаванні, замест таго, каб паўтараць інструкцыі на працягу ўсёй падказкі. У доўгіх размовах дайце кароткі змест ключавых рашэнняў. Структураваныя падказкі звычайна дапамагаюць мадэлі вызначыць прыярытэты, не марнуючы кантэкст на лішнія рэчы, якіх можна пазбегнуць.

Чаму код, фарматаванне і пунктуацыя выкарыстоўваюць токены штучнага інтэлекту?

Мадэлі штучнага інтэлекту апрацоўваюць больш, чым звычайныя словы. Аператары, дужкі, водступы, разрывы радкоў, знакі прыпынку і іншыя элементы фарматавання могуць стаць асобнымі токенамі або фрагментамі токенаў. У выніку, запыты з вялікай колькасцю кода і дакументы з высокім узроўнем фарматавання могуць хутка спажываць токены. Захаванне адпаведнага фарматавання мае значэнне, але выдаленне дублікатаў кода, непатрэбных каментарыяў або паўтаральных шаблонаў можа зрабіць запыт больш эфектыўным.

Што такое токен у штучным інтэлекце для малюнкаў, аўдыё і мультымадальных мадэляў?

У мультымадальным штучным інтэлекце тэрмін «токен» можа адносіцца да апрацоўваемых адзінак, якія выходзяць за рамкі пісьмовай мовы. Выявы могуць быць прадстаўлены з дапамогай патчаў або візуальных элементаў, а аўдыё можа быць падзелена на закадаваныя сегменты. Тэхнічны метад адрозніваецца ў розных сістэмах, але асноўны прынцып застаецца падобным: складаная інфармацыя пераўтвараецца ў меншыя лікавыя адзінкі, якія мадэль можа параўноўваць, інтэрпрэтаваць і выкарыстоўваць для генерацыі вываду.

Ці прыводзіць выкарыстанне большай колькасці токенаў да лепшай рэакцыі штучнага інтэлекту?

Не аўтаматычна. Дадатковыя токены дапамагаюць, калі яны забяспечваюць адпаведны кантэкст, прыклады, патрабаванні або зыходны матэрыял. Аднак паўтаральныя або супярэчлівыя інструкцыі могуць адцягваць увагу ад мадэлі і зніжаць паслядоўнасць. Найбольш эфектыўная падказка звычайна змяшчае дастаткова падрабязную інфармацыю, каб выразна вызначыць задачу, не перагружаючы яе. Якасць і арганізацыя токенаў часта маюць большае значэнне, чым проста колькасць тэксту.

Спасылкі

  1. Даведачны цэнтр OpenAI - help.openai.com

  2. Платформа OpenAI - platform.openai.com

  3. Распрацоўшчыкі OpenAI - developers.openai.com

  4. Google для распрацоўшчыкаў - developers.google.com

  5. Абдымны твар - huggingface.co

  6. TensorFlow - tensorflow.org

  7. Даследаванні Google - research.google

Знайдзіце найноўшы штучны інтэлект у афіцыйнай краме памочнікаў штучнага інтэлекту

Пра нас

Тэст на разуменне токенаў штучнага інтэлекту
1. Што такое токен у штучным інтэлекце простымі словамі?
2. Які максімальны ліміт вызначае, колькі токенаў мадэль штучнага інтэлекту можа разглядаць адначасова?
3. Якое сцвярджэнне пра падзел слоў на лексемы з'яўляецца правільным згодна з тэкстам?
4. Чаму зразумелыя і структураваныя падказкі карысныя для арганізацый, якія выкарыстоўваюць API штучнага інтэлекту?
5. Да якога скарачэння ўваходных токенаў прывяла аптымізацыя кантэкстных файлаў у практычным прыкладзе з памочнікам падтрымкі?
Назад да блога

Дадатковыя часта задаваныя пытанні

  • Як токенізацыя ўплывае на апрацоўку дадзеных штучным інтэлектам?

    Такенізацыя разбівае тэкст на зручныя для кіравання часткі, што дазваляе мадэлі штучнага інтэлекту эфектыўна апрацоўваць і разумець мову. Гэта ўплывае на памяць мадэлі, яе дакладнасць і кантэкст, які яна можа апрацоўваць у любы момант часу.

  • Чаму важна разумець абмежаванні токенаў у штучным інтэлекце?

    Разуменне абмежаванняў токенаў мае вырашальнае значэнне, бо дапамагае эфектыўна фармуляваць падказкі. Перавышэнне гэтых абмежаванняў можа прывесці да таго, што важная інфармацыя будзе абрэзана або ігнаравана, што паўплывае на якасць адказаў, якія генеруе штучны інтэлект.

  • Якія фактары ўплываюць на колькасць токенаў у падказках штучнага інтэлекту?

    Колькасць токенаў уключае ў сябе некалькі элементаў, такіх як словы, знакі прыпынку, прабелы і фарматаванне. У залежнасці ад токенаізатара адно слова можа быць прадстаўлена адным або некалькімі токенамі, што ўплывае на тое, як штучны інтэлект апрацоўвае ўваходныя дадзеныя.

  • Ці можа выкарыстанне токенаў паўплываць на кошт карыстання паслугай штучнага інтэлекту?

    Так, многія сэрвісы штучнага інтэлекту разлічваюць выкарыстанне на аснове колькасці апрацаваных токенаў. Больш доўгія запыты і адказы спажываюць больш токенаў, што патэнцыйна павялічвае вашы выдаткі, асабліва ў працоўных працэсах з вялікім аб'ёмам задач.

  • Як аптымізаваць падказкі, каб паменшыць непатрэбнае выкарыстанне токенаў?

    Вы можаце аптымізаваць свае падказкі, задаючы іх канкрэтна з самага пачатку, выкарыстоўваючы зразумелыя подпісы для розных раздзелаў і выдаляючы лішні тэкст-запаўняльнік. Структураваныя падказкі дапамагаюць штучнаму інтэлекту засяродзіцца на важных элементах, не марнуючы месца ў токенах на няважную інфармацыю.

  • Як токенізацыя спраўляецца са складанай мовай або сімваламі?

    Такенізацыя дапамагае сістэмам штучнага інтэлекту кіраваць складанай мовай, у тым ліку слэнгам, эмодзі або тэхнічным жаргонам, шляхам разбіцця незнаёмых слоў на пазнавальныя часткі. Гэта дазваляе лепш разумець і апрацоўваць розныя стылі мовы.

  • Што адбудзецца, калі я падам запыт, які занадта доўгі для кантэкстнага акна штучнага інтэлекту?

    Калі аб'ём запыту перавышае абмежаванні кантэкстнага акна штучнага інтэлекту, частка зместу можа быць скарочана, абагульнена або цалкам выключана з разгляду. Гэта можа прывесці да менш дакладных або няпоўных адказаў, таму важна не перавышаць ліміт.