jav @typesafeai - jestem pod wraĆŒeniem đ€© Cool. NapisaĆem kolejne demo. MyĆlÄ, ĆŒe teraz to widaÄ potÄgÄ modelu ... i o co chodzi i widaÄ prawdziwÄ wartoĆÄ biznesowÄ . Akt I - X-ray: âjedno zapytanie, wszystkie pytania naraz" - dla przykĆadowej, krĂłtkiej notatki prasowej to 67 osÄ dĂłw w ~1 s za $0.0002; dla dĆuĆŒszego RAPORTU moĆŒe byÄ i 145 osÄ dĂłw w 1,5 s za $0.0005. Skoro nie ma tokenĂłw wyjĆciowych, to dorzucenie kolejnego pytania kosztuje tylko tokeny samego pytania. Zobaczcie jak moĆŒna dynamicznie klasyfikowaÄ i jednoczeĆnie pytaÄ o wiele wymiarĂłw. Akt I odpowiada na pytanie âile" osÄ dĂłw naraz i za ile. đ„łđđđ Akt II - Firehose: âAI jako zaleĆŒnoĆÄ w pÄtli czasu rzeczywistego" - podĆÄ czyĆem siÄ do publicznego strumienia SSE Wikimedia (stream_wikimedia_org). FiltrujÄ: angielska Wikipedia, przestrzeĆ gĆĂłwna, czĆowiek (nie bot). Dla kaĆŒdej pobieram prawdziwy diff przez REST compare, ktĂłry zwraca strukturÄ zamiast HTML-a. Potem 8 pytaĆ o tÄ edycjÄ: wandalizm, spam promocyjny, atak na osobÄ, edycja testowa, usuwanie treĆci, twierdzenie bez ĆșrĂłdĆa, Score âile szkody" (0â3) i Choice âco zrobiÄ". 71 edycji w 75 sekund, 1,0 decyzji/s, mediana 306 ms, $0,19 za godzinÄ oceniania caĆej Wikipedii. RozkĆad: 49 zostaw / 20 do czĆowieka / 2 cofnij. Akt II to âgdzie", ĆŒe to moĆŒe siedzieÄ w pÄtli czasu rzeczywistego, w rdzeniu systemu. Akt III - autonomia. TypeSafe nie publikuje benchmarkĂłw âpoziomu inteligencji". Publikuje prÄdkoĆÄ i cenÄ, czyli dokĆadnie to, co i tak Ćatwo zweryfikowaÄ. Czy zatem model wie, kiedy ma racjÄ zostaje do zmierzenia uĆŒytkownikowi. No to zmierzyĆem. 300 zapytaĆ do asystenta gĆosowego, 150 moĆŒliwych intencji, a jedna piÄ ta z nich prosi o coĆ, czego asystent w ogĂłle nie obsĆuguje. Jeden przebieg. Przy progu 0.90 z dodatkowym pytaniem o zakres: - 62% ruchu obsĆuguje siÄ samo, bez czĆowieka - 99% z tego jest poprawne -> konkretnie 2 bĆÄdne odpowiedzi na 186 - 100% zapytaĆ spoza zakresu zatrzymanych - pozostaĆe 114 lÄ duje w kolejce do czĆowieka Wykr