jav @typesafeai - jestem pod wraลผeniem ๐คฉ Cool. Napisaลem kolejne demo. Myลlฤ, ลผe teraz to widaฤ potฤgฤ modelu ... i o co chodzi i widaฤ prawdziwฤ wartoลฤ biznesowฤ . Akt I - X-ray: โjedno zapytanie, wszystkie pytania naraz" - dla przykลadowej, krรณtkiej notatki prasowej to 67 osฤ dรณw w ~1 s za $0.0002; dla dลuลผszego RAPORTU moลผe byฤ i 145 osฤ dรณw w 1,5 s za $0.0005. Skoro nie ma tokenรณw wyjลciowych, to dorzucenie kolejnego pytania kosztuje tylko tokeny samego pytania. Zobaczcie jak moลผna dynamicznie klasyfikowaฤ i jednoczeลnie pytaฤ o wiele wymiarรณw. Akt I odpowiada na pytanie โile" osฤ dรณw naraz i za ile. ๐ฅณ๐๐๐ Akt II - Firehose: โAI jako zaleลผnoลฤ w pฤtli czasu rzeczywistego" - podลฤ czyลem siฤ do publicznego strumienia SSE Wikimedia (stream_wikimedia_org). Filtrujฤ: angielska Wikipedia, przestrzeล gลรณwna, czลowiek (nie bot). Dla kaลผdej pobieram prawdziwy diff przez REST compare, ktรณry zwraca strukturฤ zamiast HTML-a. Potem 8 pytaล o tฤ edycjฤ: wandalizm, spam promocyjny, atak na osobฤ, edycja testowa, usuwanie treลci, twierdzenie bez ลบrรณdลa, Score โile szkody" (0โ3) i Choice โco zrobiฤ". 71 edycji w 75 sekund, 1,0 decyzji/s, mediana 306 ms, $0,19 za godzinฤ oceniania caลej Wikipedii. Rozkลad: 49 zostaw / 20 do czลowieka / 2 cofnij. Akt II to โgdzie", ลผe to moลผe siedzieฤ w pฤtli czasu rzeczywistego, w rdzeniu systemu. Akt III - autonomia. TypeSafe nie publikuje benchmarkรณw โpoziomu inteligencji". Publikuje prฤdkoลฤ i cenฤ, czyli dokลadnie to, co i tak ลatwo zweryfikowaฤ. Czy zatem model wie, kiedy ma racjฤ zostaje do zmierzenia uลผytkownikowi. No to zmierzyลem. 300 zapytaล do asystenta gลosowego, 150 moลผliwych intencji, a jedna piฤ ta z nich prosi o coล, czego asystent w ogรณle nie obsลuguje. Jeden przebieg. Przy progu 0.90 z dodatkowym pytaniem o zakres: - 62% ruchu obsลuguje siฤ samo, bez czลowieka - 99% z tego jest poprawne -> konkretnie 2 bลฤdne odpowiedzi na 186 - 100% zapytaล spoza zakresu zatrzymanych - pozostaลe 114 lฤ duje w kolejce do czลowieka Wykr